--- name: fmode-image-set-score description: Perform a read-only, end-stage, per-image matrix review of completed image sets. Use when the user asks to 给套图打分、整体评分、终局质检、客观评估、验收商品套图、检查商品一致性、检查场景可用性、比较套图, score completed product images, or audit an existing/generated image set without generating, editing, retrying, or changing run state. Produces base quality independently, plus reference-backed fidelity and role-backed contract-fit scores when those inputs exist. --- # Fmode Image Set Score 实际打开全部成品图,建立逐图评分矩阵,再由确定性脚本计分。目录 CLI 只能检查文件;未查看图片就输出视觉分属于未完成。 ## 边界 - 只读用户明确指定的套图、参考图以及套图内显式 `state.json`/`商品原图/`;不搜索历史 run 或其他目录。 - 不调用生图、识图、编辑、增强、返修或重试,不读取凭据,不修改图片、state 或 run。 - 模型只提交固定状态和可定位观察,不能修改权重、分值、聚合、硬失败或资格门禁。 - 基础质量不证明商品一致;图片评审不预测 CTR、CVR、ROAS 或销量。 ## 四层结果 1. `qualityScore`:只依赖成品图;技术、交付、逐图视觉、套图质量与通用商品展示可用性。 2. `fidelityScore`:必须逐图引用实际商品参考;无参考为 N/A。 3. `contractFitScore`:必须有每张图的显式角色/用途合同;缺角色为 N/A。 4. `assuredOverallScore`:前三层全部合格取证后才出现;不要用 `qualityScore` 冒充完整保障分。 详细字段和资格规则见 [references/scoring-contract.md](references/scoring-contract.md),固定 rubric 见 [references/visual-rubric.md](references/visual-rubric.md)。 ## 工作流 ### 1. 固定输入 - 列出顶层成品图;不要把 `商品原图/` 当成品图。 - 受管理套图可只读提取 `state.json.payload.items` 的角色、标题、模板、安全区和文字要求;忽略旧质量分。 - 将 `商品原图/` 或用户显式图片声明为 `referenceImages`。 - 先运行目录 JSON 基线并保留候选/参考 SHA-256。 ### 2. Pass A:逐图事实观察 逐一用宿主图片查看能力打开原分辨率图片,只记录可见事实:商品结构、颜色、材质、文字、构图、清晰度、光影、裁切以及异常位置。此阶段不评分。 ### 3. Pass B:跨图和参考复核 - 将全部成品并排复核连贯性、镜头差异、内容冗余和通用商品旅程。 - 有参考时打开全部参考图,比较结构、比例、颜色、材质、Logo/文字、独特细节和变体。 - 有角色时逐图核验角色完成度、主体、角度、场景、安全区与必需信息。 ### 4. 建立 v3 矩阵 - 图片级 rubric 必须为每张可读成品图各提交一个 `assessment`。 - 套图级 rubric 必须在 `imagePaths` 中精确包含全部可读成品图。 - 状态仅限 `pass/minor/major/critical/na`;非 pass/na 必须给最小整改,na 必须说明原因。 - `observation` 必须可证伪,`locator` 必须指向画面区域或跨图范围;“整体不错”“符合要求”无效。 - PF 项必须列出实际比较的 `referencePaths` 和具体 `comparisonBasis`。 - 不提交 `source=human_verified` 来提高可信度;单次结构化 AI 审查最高为 medium。 ### 5. 无落盘计分 通过 stdin 传入 `score-contract/v3`,不要在套图目录创建 manifest: ```powershell $OutputEncoding = [System.Text.UTF8Encoding]::new($false) @' { "schemaVersion": "score-contract/v3", "profile": "generic", "images": [{ "path": "H1.jpg", "role": "hero" }], "referenceImages": [], "assessments": [] } '@ | node "<本 Skill>/scripts/score-image-set.mjs" --manifest - --base "<套图目录>" --format markdown ``` Windows 管道必须使用 UTF-8,防止中文路径损坏。脚本继续读取 v1/v2 manifest,但新评分必须使用 v3。 ### 6. 放行与输出 - `qualityScore` 需要 quality 矩阵的必评单元 100% 覆盖且全部有分。 - `fidelityScore` 还需要 PF 矩阵和全部声明参考图实际使用。 - `contractFitScore` 还需要角色完整和 CF 矩阵完整。 - `assuredOverallScore` 需要前三层都具备资格。 - critical 由脚本固定为硬失败并限制分数;不能用高分图片平均掉。 按以下顺序报告:查看数量、四层分数与等级、单元覆盖、可信度、分类分、单图分、最弱图片、最弱 rubric、硬失败、findings、N/A、资格缺口和最小整改。明确单次模型审查不是独立人工验证。