# 人工复核交接说明 这份文档用于 live / overnight / sample 提号结果生成后,交给商务或运营复核候选博主。所有 CSV 均按 Excel 直接打开做了 UTF-8 BOM 处理。 ## 复核表位置 常见输出位置: ```text outputs/<本次运行目录>/manual-review-sample.csv outputs/<本次运行目录>/tihao-sourcing-client-list.csv outputs/software-client-latest/software-client-list.final.csv ``` 如果还没有本轮复核表,或需要先给商务发一套历史数据/复核数据收集模板,可以运行: ```powershell npm run data:intake-template -- --output outputs\data-intake-pack-latest ``` 生成的 `manual-review-template.csv` 已包含 `客户选择`、`归因类型`、`反馈原因` 和 `本轮人工补号量` 字段,可直接用于后续 `review:metrics` 和 `customer-effect:audit`。 ## 复核标签 请在 CSV 的 `人工复核标签` 列填写下列任一标签: | 标签 | 适用场景 | 是否必须填写归因 | | --- | --- | --- | | 可直接发客户 | 符合 Brief、调性、主页证据和风险边界,可进入客户预览名单 | 否 | | 商务复核 | 大体匹配,但报价、档期、竞品合作、近期内容或平台风险仍需确认 | 否 | | 跑偏 | 人群、品类、平台、预算、场景或合作方向明显偏离 Brief | 是 | | 硬性规则违约 | 命中必须剔除项,例如平台、粉丝、预算、地域、类目或客户明确排除项不符 | 是 | | 调性不符 | 硬指标可用,但内容表达、视觉质感、语气、人设或参考账号风格明显不一致 | 是 | | 主页质感不符 | 最近内容质量、封面、互动、更新频率、商业化痕迹或风险信号不足以支持推荐 | 是 | | 参考账号不像 | 客户给了参考账号/视频,但候选人与参考的人群、内容结构或风格相似度不足 | 是 | | 待客户反馈 | 已发客户或准备发客户,但客户尚未给最终结果 | 否 | | 客户选中 | 客户最终确认选择该候选人,可用于客户效果审计 | 否 | | 客户拒绝 | 客户最终拒绝该候选人,必须补拒绝原因或反馈原因 | 是 | 负样本包括:`跑偏`、`硬性规则违约`、`调性不符`、`主页质感不符`、`参考账号不像`、`客户拒绝`。负样本必须填写 `归因类型` 和 `反馈原因`,否则严格验收不通过。 ## 归因类型 | 归因类型 | 说明 | | --- | --- | | 需求解析错 | Brief 里的品类、人群、预算、平台、地域或硬性限制被解析错 | | 隐性规则漏 | 客户偏好、历史排除项、风格禁区或团队经验规则没有进入筛选 | | 召回关键词错 | 关键词召回方向太宽、太窄,或平台搜索词不贴合真实场景 | | 主页证据不足 | 最近内容、封面、标题、互动、发布时间或风险证据不足 | | 视频证据误判 | 参考视频或候选视频的风格、场景、口播、画面质感、ASR 被误判 | | 排序权重错 | 候选已召回,但弱相关、低质感或高风险账号排得过高 | | 输出解释错 | 推荐理由、风险提示或证据卡表达不清,导致商务难以判断 | | 软件端表重复或排名不连续 | 重复键异常、排名断档、字段不稳定或软件端表格问题 | ## 复核顺序 1. 先看 `result-first-broad`,这是完整矩阵里表现最好的发布策略。 2. 再看 `result-first`,这是消耗更低的发布备选策略。 3. `video-enhanced` 和 `result-first-risk` 只作诊断样本,用来观察视频证据和风险提示是否合理。 4. 多个策略重复出现的博主,发客户前必须合并去重,并保持同一 Brief 下排名连续。 ## 复核重点 - 主页链接是否有效,账号是否仍然是同一个博主。 - 最近 10 篇内容是否真的匹配 Brief 品类、人群和内容调性。 - 博主是否能承接客户要的风格,而不是只命中了一个关键词。 - 报价、粉丝数、主页信息需要商务二次确认。 - 涉及功效、母婴、食品、护肤等敏感表达时,必须人工确认合规风险。 - 有参考账号或参考视频时,要看“像不像参考账号/视频”,不要只看平台标签。 ## 质量指标统计 人工标注完成后运行: ```powershell npm run review:metrics -- --input <已标注CSV> --output <输出目录> --strict ``` 会生成: ```text review-metrics-summary.json review-metrics-report.md ``` 核心指标: - 商务可用率 = `可直接发客户 + 商务复核` / 已标注总数,短期目标 >= 60%。 - 负样本率 = 负样本 / 已标注总数,目标 <= 10%。 - 负样本归因覆盖率 = 已填写归因类型的负样本 / 负样本总数,目标 100%。 - 客户选中率 = `客户选中` / 已标注总数,短期目标 >= 30%;`客户选择` 未标注时不得宣称达到客户选中率。 - 参考链路客户选中率 = 有参考账号/参考视频链路的 `客户选中` / 这些策略已标注总数,中期目标 >= 40%。 - 参考链路通过率对照必须高于 `baseline-live / brief-only / keyword-only`,否则不能宣称参考链路优于纯关键词召回。 - 软件端重复键必须为 0。 - 每个 Brief 排名必须连续。 ## 客户效果证明 如果已经拿到真实历史数据集审计结果,并且本轮有人工补号量,可以继续运行: ```powershell npm run customer-effect:audit -- --review-csv <已标注CSV> --history-audit --current-manual-supplement-count <本轮人工补号量> --output <输出目录> --strict ``` 客户效果证明的硬性口径: - 客户选中率达到 30% 以上,才可证明短期客户效果。 - 长期客户选中率达到 50% 以上,才可证明长期目标。 - 有参考账号/参考视频的 Brief,参考链路客户选中率达到 40% 以上。 - 历史数据集必须通过 `readyForCustomerEffectProof`。 - 必须同时有历史人工补号量基线和本轮人工补号量,才可证明“人工补号量减少 50%”。 缺少任一真实证据时,报告会标记为 `待补数据` 或 `未通过`,不能宣称客户效果已经达标。 ## 当前自动化证据边界 目前自动化可以证明: - SOP、表单、复核标签、归因字段、去重、连续排名、软件端导出、安装和发布前验收链路可运行。 - sample/smoke/provider mock 可以验证流程完整性。 - `manual-review-label-guide` 已沉淀 10 个复核标签和 8 个归因类型。 目前仍不能单独证明: - 命中率已经提升。 - 客户选中率已经达标。 - 视频分析一定提升提号效果。 - 人工补号量已经减少。 这些必须等真实客户复核 CSV、真实历史 Brief 数据集、真实视频资源和 live provider 审计补齐后,再进入效果验收。