ai-optimization-task-software-table.md 9.0 KB

AI 提号优化任务表

本文档是给 AI 长跑任务和软件端任务配置直接引用的表格版说明。所有真实 token、sessionToken、模型 key 只能通过运行时环境变量传入,不得写入任务表、日志或输出文件。

1. 任务总表

阶段 输入 AI 动作 输出文件 验收标准 不通过处理
运行前检查 本地代码、npm 包、mock provider 执行 npm run acceptancenpm run acceptance:providers:mocknpm run optimization:status outputs/optimization-status-*/optimization-status-report.md package、MCP、mock provider、软件端表、视频 A/B smoke 全部通过;泄密和乱码扫描为 0 先修自动化失败项,不启动 live 长跑
真实数据准备 5-10 个历史 Brief、参考账号/视频、人工最终名单、客户选择/拒绝记录、人工补号量基线 执行 npm run history:audit -- --input <目录> --output <目录> --strict historical-dataset-audit-report.mdhistorical-dataset-audit.json 每个 Brief 都有人工名单、客户选择或拒绝原因;要证明人工补号减少时必须有历史人工补号基线 缺字段时只允许做流程测试,不能宣称客户效果达标
受控 live 子集 真实 Parse sessionToken、company、VOC social token、视频分析运行时 token 小规模跑 baseline-livereference-accounthomepage-evidenceresult-first tihao-sourcing-report.mdtihao-sourcing-result.jsontihao-sourcing-client-list.csv 业务接口可用;输出无 token;软件端表重复键为 0;每个 brief 排名连续 记录失败原因,先修鉴权、召回、provider 或输出结构
完整策略矩阵 覆盖多个品类的历史 Brief baseline-livereference-accounthomepage-evidencevideo-enhancedresult-firstresult-first-broad aggregate-report.mdaggregate-summary.jsonmanual-review-sample.csv failureCount=0;每个 Brief 至少一个策略通过;每个 Brief 至少产出目标人数 1.5 倍可复核候选 每轮只优化一个主要失败原因,重跑同一矩阵对比
参考视频 A/B 同一 Brief、同一参考视频、真实视频 URL、豆包视频分析服务 执行 npm run acceptance:video-ab,对比无视频证据和有视频证据两组 video-hit-rate-report.mdvideo-hit-rate-summary.json B 组拿到真实视频 URL;拿到封面、字幕/ASR、帧图至少一类;证据卡不是占位;强推荐数、Top 10 平均分、参考风格分不下降;证据命中候选增加 不能说视频分析已提升命中率;按视频资源、证据解析、排序权重分别修
人工复核 已预置 客户选择归因类型反馈原因 列的 manual-review-sample.csv 商务填写人工复核标签;负样本填写归因类型;有客户反馈时填写客户选择 标注后的 CSV、review-metrics-report.md 商务可用率 >= 60%;负样本率 <= 10%;负样本归因覆盖率 = 100%;有客户选择时客户选中率 >= 30% 按归因类型进入下一轮优化,不降低门槛
反馈闭环 商务负样本反馈、客户偏好、剔除账号 导入偏好记忆并重跑第二轮 tihao-preference-memory.json、第二轮软件端 CSV 被拉黑或跑偏账号不再进入商务名单;调性/主页质感反馈写入偏好;同类反馈 3 次以上才建议团队规则 检查记忆写入、剔除规则、排序降权是否生效
状态沉淀 本轮命令、输出目录、指标和边界 更新实施日志并执行 npm run optimization:statusnpm run evidence:index 实施日志、状态审计报告、证据台账 passedready_not_provenblocked_by_external_data 状态清楚;未证明项不被标成完成 保留边界说明,等待真实 provider 或客户数据

2. 软件端博主表固定格式

软件端最终接收的博主名单必须使用以下字段,默认文件名为 tihao-sourcing-client-list.csv。交付表按“全局博主唯一”去重:同一 平台 + 规范化主页链接 不得重复;没有主页链接时,同一 平台 + 规范化博主名称 不得重复。同一博主被多个 brief 或多个策略召回时,只保留证据更完整、综合分更高的一条进入交付表。

brief编号 策略 排名 平台 博主名称 综合分 brief匹配分 参考风格分 主页证据分 视觉质感分 调性一致分 证据加分 证据风险扣分 推荐理由 风险提示 主页链接 人工复核标签
客户 Brief 编号或品牌名 baseline-live / reference-account / homepage-evidence / video-enhanced / result-first / result-first-broad 去重后的连续排名 小红书/抖音/B站 账号展示名 最终排序分 硬性条件、人群、预算、关键词匹配分 参考账号或参考视频风格相似分 主页最近内容证据分 封面、画面、排版、场景质感分 近期内容调性一致分 provider 或多模态证据加分 竞品、跑偏、内容不符等扣分 说明 Brief 命中点、参考风格或主页证据 说明报价、档期、竞品、合规或证据缺口 博主主页 URL 商务填写

3. 人工复核标签表

标签 判定口径 是否计入负样本 后续动作
可直接发客户 硬性条件、调性、主页证据都通过 可进入客户名单
商务复核 基本可用,但需要确认报价、档期、近期内容或合作状态 补证后决定是否发客户
可投但需补证 候选有潜力,但缺视频、主页近作或人工确认 优先补证,不直接算失败
跑偏 内容方向、账号人设或品类明显偏离 Brief 写入失败归因并降权或剔除
硬性规则违约 平台、粉丝、预算、地域、禁投项不符合 进入硬规则拦截
调性不符 数据可用,但风格不像参考账号或不适合品牌 写入调性偏好或负向风格
主页质感不符 封面、画面、排版、场景明显低质或下沉 提高主页证据和视觉质感权重
参考账号不像 参考链路召回但类型/调性相似度不足 调整参考账号拆解和相似度阈值

4. 去重和候选池验收

检查项 通过标准 自动化入口
表头固定 表头与 docs/software-client-table-format.md 完全一致 npm run software:smoke
重复键 软件端表重复键数量为 0 npm run software:smokenpm run candidate-pool:smoke
排名连续 每个 brief 内排名从 1 开始连续 npm run software:smokenpm run candidate-pool:smoke
候选池规模 每个 Brief 至少输出目标人数 1.5 倍的可复核候选;不足时必须给出补量提示 npm run candidate-pool:smoke
剔除账号 已剔除账号不得进入软件端交付表 npm run hard-rules:smoke
中文编码 CSV 使用 UTF-8 BOM,Excel 打开不乱码 npm run software:smoke
表格版沉淀 已去重 CSV 可以转换成同字段 Markdown 表格 npm run software:markdown -- --input <CSV> --output <MD>

5. 对 AI 的执行指令

项目 指令
目标 优化 @vocmarket/tihao 的提号命中率和商务可用率,让上传 Brief 后能稳定输出商务可复核、可解释、可沉淀的博主名单。
优先级 本轮优先结果质量,不优先压成本;但不得泄露任何 token、sessionToken、Authorization 或模型 key。
策略 每个 Brief 跑基础召回、参考账号、主页证据、视频增强、结果优先、扩大召回后重排等策略,并按同一指标比较。
指标 强推荐数量、Top 10 平均综合分、参考风格分、主页证据覆盖率、商务可用率、负样本率、客户选中率、人工补号量。
强推荐证据 每个强推荐必须至少有 2 条 Brief 命中点,并至少有 1 条 referenceStyleHitPointshomepageEvidenceHitPoints
参考占位证据 需补相似账号证据待补参考风格证据 只能写入 referenceFallbackHitPoints,不得混入 referenceStyleHitPointsreferenceEvidenceConcrete=false 时不得单独支撑强推荐。
主页质感门槛 命中封面下沉、封面混乱、排版混乱、画面模糊、低质等风险时,不得进入强推荐,并保留 homepageQualityRisks
归因 每个失败样本必须归到需求解析错、隐性规则漏、召回关键词错、主页证据不足、视频证据误判、排序权重错、输出解释错、软件端表重复或排名不连续之一。
迭代 每轮只优化一个主要失败原因,重跑同一矩阵,记录 baseline 与优化后指标差异。
禁止 不得把 sample 通过当成真实命中率证明;不得把 provider fallback 当成真实 provider 通过;不得为了通过而降低门槛。