持续优化 @vocmarket/tihao,直到它能稳定把客户 Brief 转成商务可用的博主名单。优先级是结果质量:更高命中率、更强 Brief 相关性、更有效的参考账号/参考视频风格匹配、更低负样本率。
本轮不以成本为第一约束,但任何 token、sessionToken、模型 key、Authorization header 都不能写入代码、文档、报告、日志或输出文件。
E:\workspace\tihao-ai\claude-code-tihao-sourcing
先跑本地发布验收:
npm run acceptance
npm run acceptance:providers:mock
npm run optimization:status
如果要验证真实 live/provider/video,先跑预检:
$env:TIHAO_SESSION_TOKEN="<Parse sessionToken>"
$env:TIHAO_COMPANY="<Company objectId>"
$env:VOC_SOCIAL_TOKEN="<Parse sessionToken>"
$env:VIDEO_ANALYSIS_BASE_URL="https://api.fmode.cn"
$env:VIDEO_ANALYSIS_MODEL="doubao-seed-2-0-pro"
$env:VIDEO_ANALYSIS_TOKEN="<runtime model token>"
npm run live:preflight -- --strict
预检失败时不要启动 live 长跑。
把 live 预检和历史数据审计汇总成可交接的长跑就绪报告:
npm run longrun:readiness -- --mode full-matrix --preflight <live-preflight-summary.json> --history <historical-dataset-audit.json> --output <输出目录> --strict
如果要验证视频 A/B:
npm run longrun:readiness -- --mode video-ab --preflight <live-preflight-summary.json> --strict
如果要验证客户选中率和人工补号减少:
npm run longrun:readiness -- --mode customer-effect --preflight <live-preflight-summary.json> --history <historical-dataset-audit.json> --strict
如要验证客户选中率,先准备 5-10 个真实历史 Brief,包含客户原始 Brief、参考账号/视频、人工最终名单、客户最终选中/拒绝记录和拒绝原因。
验收:
npm run history:audit -- --input <history-dataset目录> --output <输出目录> --strict
只有 history:audit 显示可用于长期优化长跑,才可以验证客户选中率 30%/50%。没有真实客户选择字段时,只能验证商务复核通过率。
正式长跑前先跑小子集。它会消耗真实额度,范围要小。
$env:TIHAO_OVERNIGHT_LIVE="true"
$env:TIHAO_OVERNIGHT_FIXTURES="dha-mom-baby"
$env:TIHAO_OVERNIGHT_VARIANTS="baseline-live,reference-account,homepage-evidence,result-first"
$env:TIHAO_OVERNIGHT_MAX_RUNS="4"
$env:TIHAO_OVERNIGHT_FAIL_ON_GATES="true"
npm run overnight:quality
如果要验证真实 reference/homepage provider,打开严格门槛:
$env:TIHAO_GATE_REQUIRE_REFERENCE_PROVIDER="true"
$env:TIHAO_GATE_REQUIRE_HOMEPAGE_PROVIDER="true"
严格门槛打开后,fallback/sample 失败是正确结果,不要为了通过降低门槛。
受控子集通过后再跑完整矩阵:
$env:TIHAO_OVERNIGHT_FIXTURES="dha-mom-baby,sensitive-skin-repair,healthy-snack,home-cleaning,618-list-seeding"
$env:TIHAO_OVERNIGHT_VARIANTS="baseline-live,reference-account,homepage-evidence,video-enhanced,result-first,result-first-risk,result-first-broad"
$env:TIHAO_OVERNIGHT_DELAY_MS="1500"
$env:TIHAO_OVERNIGHT_RUN_RETRIES="1"
$env:TIHAO_OVERNIGHT_RESUME="true"
$env:TIHAO_OVERNIGHT_FAIL_ON_GATES="true"
npm run overnight:quality
查看:
outputs/overnight-quality-*/aggregate-summary.json
outputs/overnight-quality-*/aggregate-report.md
outputs/overnight-quality-*/manual-review-sample.csv
有参考视频时,单独验证视频分析是否真的提升提号结果:
npm run acceptance:video-ab
通过标准:
没有通过这条命令,不要说视频分析已经证明能提升提号率。
人工复核 manual-review-sample.csv。长跑表已预置 客户选择、归因类型、反馈原因 三列,商务不用手动加列。
在“人工复核标签”列填写:
可直接发客户商务复核跑偏硬性规则违约调性不符主页质感不符参考账号不像可投但需补证如果拿到客户最终选择,在 客户选择 列填写:
客户选中客户拒绝待客户反馈所有负样本必须填写 归因类型。负样本包括:
跑偏硬性规则违约调性不符主页质感不符参考账号不像归因类型必须落到可优化环节,例如:
需求解析错隐性规则漏召回关键词错主页证据不足视频证据误判排序权重错输出解释错软件端表重复或排名不连续统计业务指标:
npm run review:metrics -- --input <已标注CSV> --output <输出目录> --strict
短期目标:
中长期目标:
不要降低门槛来凑通过。按失败样本归因:
每轮只优化一个主要失败原因,重跑同一矩阵并记录提升。
每轮结束后更新:
docs/tihao-experience-implementation-log.md
记录:
failureCount、gatePass、failedGateCount。同时运行:
npm run optimization:status
npm run evidence:index
如果状态里仍有 ready_not_proven 或 blocked_by_external_data,不要宣布长期优化目标完成。evidence:index 会扫描 outputs 下的长跑、状态审计、review metrics、历史数据审计和视频 A/B 产物,区分 real_evidence、smoke_or_local 和 not_business_proof。
manifest.liveEnabled=false 时声称已经 live 验证。review-metrics 报告。