manual-review-handoff.md 6.6 KB

人工复核交接说明

这份文档用于 live / overnight / sample 提号结果生成后,交给商务或运营复核候选博主。所有 CSV 均按 Excel 直接打开做了 UTF-8 BOM 处理。

复核表位置

常见输出位置:

outputs/<本次运行目录>/manual-review-sample.csv
outputs/<本次运行目录>/tihao-sourcing-client-list.csv
outputs/software-client-latest/software-client-list.final.csv

如果还没有本轮复核表,或需要先给商务发一套历史数据/复核数据收集模板,可以运行:

npm run data:intake-template -- --output outputs\data-intake-pack-latest

生成的 manual-review-template.csv 已包含 客户选择归因类型反馈原因本轮人工补号量 字段,可直接用于后续 review:metricscustomer-effect:audit

复核标签

请在 CSV 的 人工复核标签 列填写下列任一标签:

标签 适用场景 是否必须填写归因
可直接发客户 符合 Brief、调性、主页证据和风险边界,可进入客户预览名单
商务复核 大体匹配,但报价、档期、竞品合作、近期内容或平台风险仍需确认
跑偏 人群、品类、平台、预算、场景或合作方向明显偏离 Brief
硬性规则违约 命中必须剔除项,例如平台、粉丝、预算、地域、类目或客户明确排除项不符
调性不符 硬指标可用,但内容表达、视觉质感、语气、人设或参考账号风格明显不一致
主页质感不符 最近内容质量、封面、互动、更新频率、商业化痕迹或风险信号不足以支持推荐
参考账号不像 客户给了参考账号/视频,但候选人与参考的人群、内容结构或风格相似度不足
待客户反馈 已发客户或准备发客户,但客户尚未给最终结果
客户选中 客户最终确认选择该候选人,可用于客户效果审计
客户拒绝 客户最终拒绝该候选人,必须补拒绝原因或反馈原因

负样本包括:跑偏硬性规则违约调性不符主页质感不符参考账号不像客户拒绝。负样本必须填写 归因类型反馈原因,否则严格验收不通过。

归因类型

归因类型 说明
需求解析错 Brief 里的品类、人群、预算、平台、地域或硬性限制被解析错
隐性规则漏 客户偏好、历史排除项、风格禁区或团队经验规则没有进入筛选
召回关键词错 关键词召回方向太宽、太窄,或平台搜索词不贴合真实场景
主页证据不足 最近内容、封面、标题、互动、发布时间或风险证据不足
视频证据误判 参考视频或候选视频的风格、场景、口播、画面质感、ASR 被误判
排序权重错 候选已召回,但弱相关、低质感或高风险账号排得过高
输出解释错 推荐理由、风险提示或证据卡表达不清,导致商务难以判断
软件端表重复或排名不连续 重复键异常、排名断档、字段不稳定或软件端表格问题

复核顺序

  1. 先看 result-first-broad,这是完整矩阵里表现最好的发布策略。
  2. 再看 result-first,这是消耗更低的发布备选策略。
  3. video-enhancedresult-first-risk 只作诊断样本,用来观察视频证据和风险提示是否合理。
  4. 多个策略重复出现的博主,发客户前必须合并去重,并保持同一 Brief 下排名连续。

复核重点

  • 主页链接是否有效,账号是否仍然是同一个博主。
  • 最近 10 篇内容是否真的匹配 Brief 品类、人群和内容调性。
  • 博主是否能承接客户要的风格,而不是只命中了一个关键词。
  • 报价、粉丝数、主页信息需要商务二次确认。
  • 涉及功效、母婴、食品、护肤等敏感表达时,必须人工确认合规风险。
  • 有参考账号或参考视频时,要看“像不像参考账号/视频”,不要只看平台标签。

质量指标统计

人工标注完成后运行:

npm run review:metrics -- --input <已标注CSV> --output <输出目录> --strict

会生成:

review-metrics-summary.json
review-metrics-report.md

核心指标:

  • 商务可用率 = 可直接发客户 + 商务复核 / 已标注总数,短期目标 >= 60%。
  • 负样本率 = 负样本 / 已标注总数,目标 <= 10%。
  • 负样本归因覆盖率 = 已填写归因类型的负样本 / 负样本总数,目标 100%。
  • 客户选中率 = 客户选中 / 已标注总数,短期目标 >= 30%;客户选择 未标注时不得宣称达到客户选中率。
  • 参考链路客户选中率 = 有参考账号/参考视频链路的 客户选中 / 这些策略已标注总数,中期目标 >= 40%。
  • 参考链路通过率对照必须高于 baseline-live / brief-only / keyword-only,否则不能宣称参考链路优于纯关键词召回。
  • 软件端重复键必须为 0。
  • 每个 Brief 排名必须连续。

客户效果证明

如果已经拿到真实历史数据集审计结果,并且本轮有人工补号量,可以继续运行:

npm run customer-effect:audit -- --review-csv <已标注CSV> --history-audit <historical-dataset-audit.json> --current-manual-supplement-count <本轮人工补号量> --output <输出目录> --strict

客户效果证明的硬性口径:

  • 客户选中率达到 30% 以上,才可证明短期客户效果。
  • 长期客户选中率达到 50% 以上,才可证明长期目标。
  • 有参考账号/参考视频的 Brief,参考链路客户选中率达到 40% 以上。
  • 历史数据集必须通过 readyForCustomerEffectProof
  • 必须同时有历史人工补号量基线和本轮人工补号量,才可证明“人工补号量减少 50%”。

缺少任一真实证据时,报告会标记为 待补数据未通过,不能宣称客户效果已经达标。

当前自动化证据边界

目前自动化可以证明:

  • SOP、表单、复核标签、归因字段、去重、连续排名、软件端导出、安装和发布前验收链路可运行。
  • sample/smoke/provider mock 可以验证流程完整性。
  • manual-review-label-guide 已沉淀 10 个复核标签和 8 个归因类型。

目前仍不能单独证明:

  • 命中率已经提升。
  • 客户选中率已经达标。
  • 视频分析一定提升提号效果。
  • 人工补号量已经减少。

这些必须等真实客户复核 CSV、真实历史 Brief 数据集、真实视频资源和 live provider 审计补齐后,再进入效果验收。