这份文档用于 live / overnight / sample 提号结果生成后,交给商务或运营复核候选博主。所有 CSV 均按 Excel 直接打开做了 UTF-8 BOM 处理。
常见输出位置:
outputs/<本次运行目录>/manual-review-sample.csv
outputs/<本次运行目录>/tihao-sourcing-client-list.csv
outputs/software-client-latest/software-client-list.final.csv
如果还没有本轮复核表,或需要先给商务发一套历史数据/复核数据收集模板,可以运行:
npm run data:intake-template -- --output outputs\data-intake-pack-latest
生成的 manual-review-template.csv 已包含 客户选择、归因类型、反馈原因 和 本轮人工补号量 字段,可直接用于后续 review:metrics 和 customer-effect:audit。
请在 CSV 的 人工复核标签 列填写下列任一标签:
| 标签 | 适用场景 | 是否必须填写归因 |
|---|---|---|
| 可直接发客户 | 符合 Brief、调性、主页证据和风险边界,可进入客户预览名单 | 否 |
| 商务复核 | 大体匹配,但报价、档期、竞品合作、近期内容或平台风险仍需确认 | 否 |
| 跑偏 | 人群、品类、平台、预算、场景或合作方向明显偏离 Brief | 是 |
| 硬性规则违约 | 命中必须剔除项,例如平台、粉丝、预算、地域、类目或客户明确排除项不符 | 是 |
| 调性不符 | 硬指标可用,但内容表达、视觉质感、语气、人设或参考账号风格明显不一致 | 是 |
| 主页质感不符 | 最近内容质量、封面、互动、更新频率、商业化痕迹或风险信号不足以支持推荐 | 是 |
| 参考账号不像 | 客户给了参考账号/视频,但候选人与参考的人群、内容结构或风格相似度不足 | 是 |
| 待客户反馈 | 已发客户或准备发客户,但客户尚未给最终结果 | 否 |
| 客户选中 | 客户最终确认选择该候选人,可用于客户效果审计 | 否 |
| 客户拒绝 | 客户最终拒绝该候选人,必须补拒绝原因或反馈原因 | 是 |
负样本包括:跑偏、硬性规则违约、调性不符、主页质感不符、参考账号不像、客户拒绝。负样本必须填写 归因类型 和 反馈原因,否则严格验收不通过。
| 归因类型 | 说明 |
|---|---|
| 需求解析错 | Brief 里的品类、人群、预算、平台、地域或硬性限制被解析错 |
| 隐性规则漏 | 客户偏好、历史排除项、风格禁区或团队经验规则没有进入筛选 |
| 召回关键词错 | 关键词召回方向太宽、太窄,或平台搜索词不贴合真实场景 |
| 主页证据不足 | 最近内容、封面、标题、互动、发布时间或风险证据不足 |
| 视频证据误判 | 参考视频或候选视频的风格、场景、口播、画面质感、ASR 被误判 |
| 排序权重错 | 候选已召回,但弱相关、低质感或高风险账号排得过高 |
| 输出解释错 | 推荐理由、风险提示或证据卡表达不清,导致商务难以判断 |
| 软件端表重复或排名不连续 | 重复键异常、排名断档、字段不稳定或软件端表格问题 |
result-first-broad,这是完整矩阵里表现最好的发布策略。result-first,这是消耗更低的发布备选策略。video-enhanced 和 result-first-risk 只作诊断样本,用来观察视频证据和风险提示是否合理。人工标注完成后运行:
npm run review:metrics -- --input <已标注CSV> --output <输出目录> --strict
会生成:
review-metrics-summary.json
review-metrics-report.md
核心指标:
可直接发客户 + 商务复核 / 已标注总数,短期目标 >= 60%。客户选中 / 已标注总数,短期目标 >= 30%;客户选择 未标注时不得宣称达到客户选中率。客户选中 / 这些策略已标注总数,中期目标 >= 40%。baseline-live / brief-only / keyword-only,否则不能宣称参考链路优于纯关键词召回。如果已经拿到真实历史数据集审计结果,并且本轮有人工补号量,可以继续运行:
npm run customer-effect:audit -- --review-csv <已标注CSV> --history-audit <historical-dataset-audit.json> --current-manual-supplement-count <本轮人工补号量> --output <输出目录> --strict
客户效果证明的硬性口径:
readyForCustomerEffectProof。缺少任一真实证据时,报告会标记为 待补数据 或 未通过,不能宣称客户效果已经达标。
目前自动化可以证明:
manual-review-label-guide 已沉淀 10 个复核标签和 8 个归因类型。目前仍不能单独证明:
这些必须等真实客户复核 CSV、真实历史 Brief 数据集、真实视频资源和 live provider 审计补齐后,再进入效果验收。