# Phase 3 · 采集规划 Collection Planning > 把 H1-H8 假设 → **关键词 × 平台 × 批次** 矩阵 —— 决定接下来 50-120 分钟的 API 调度。 --- ## 🎯 目标 **输入**:P2 的 VOC 思路文档(含 8 假设 + 竞品地图) **输出**:`docs/<品类>/3.采集矩阵.md`,包含: 1. **30-50 关键词** × **2-3 批次**(P0/P1/P2 优先级) 2. **2-6 平台**的关键词映射(不同平台有不同热词) 3. **每 kw 预期条数**(指导 API `max_items`) 4. **假设覆盖表**(验证每条 H 都有 ≥ 3 kw 覆盖) --- ## 🔑 核心框架 ### 框架 A · 关键词四象限 每个品类的关键词应该覆盖 4 个象限: ``` 本品 ←──────────→ 对立品 │ │ │ │ 头部 ────┼─ 象限 I ─┼── 象限 II │ 本品直搜 │ 头部竞品 │ │ │ 象限 III │ 象限 IV │ 场景痛点 │ 长尾 / 相邻 长尾 ────┴───────────┴────── ``` | 象限 | 例子(乳酸菌素片儿童版) | 预期条数 | |---|---|---| | **I · 本品直搜** | 江中乳酸菌素片 · 江中乳酸菌素片儿童 · 乳酸菌素片 | 每 kw 60-100 条 | | **II · 头部竞品** | 妈咪爱 · 合生元益生菌 · 亿活 儿童 · 拜奥 · 金双岐 | 每 kw 50-80 条 | | **III · 场景痛点** | 宝宝便秘 · 宝宝积食 · 宝宝腹泻 · 儿童挑食 · 抗生素 益生菌 | 每 kw 40-60 条 | | **IV · 长尾/相邻** | inne 噗噗宝 · 康萃乐 · 万益蓝 · 儿童营养软糖 · 瓶瓶罐罐 | 每 kw 20-50 条 | **合理比例**:30% I + 30% II + 20% III + 20% IV (本品 + 头部竞品共占 60%,保证数据基础) --- ### 框架 B · 批次设计(P0 / P1 / P2) **为什么要分批**: - API 有 rate limit,一次跑完 50 关键词容易失败 - 分批可以**边采边分析**,发现 VOC 不足及时补采 - 出错后只需要重跑单一批次 **三批次标准划分**: | 批次 | 内容 | kw 数 | 预期耗时 | 何时跑 | |---|---|---|---|---| | **P0 Batch 1** | 本品 + 头部竞品(象限 I + II) | 12-18 | 20-30 分钟 | 先跑,确保基础盘 | | **P1 Batch 2** | 次级竞品 + 核心场景(象限 II 尾 + III) | 10-15 | 15-25 分钟 | 等 B1 跑完评估后 | | **P2 Batch 3** | 长尾 + 决策 + 相邻(象限 IV) | 10-15 | 12-20 分钟 | B2 跑完后补齐 H6/H7/H8 | **实战参考**(乳酸菌项目): - Batch 1: 11 XHS + 5 DY = 16 kw, 20 分钟 - Batch 2: 10 XHS + 3 DY = 13 kw, 15 分钟 - Batch 3: 10 XHS + 2 DY = 12 kw, 12 分钟 - **总计**:31 XHS + 10 DY = 41 kw / ~50 分钟 / **2566 真实评论** --- ### 框架 C · 多平台关键词映射 **不同平台有不同的用户表达习惯**,同一假设要换用不同的热词: | 平台 | 用户特点 | 关键词偏好 | 避免 | |---|---|---|---| | **小红书 XHS** | 新手妈妈 / 年轻女性 / 种草 | 日常 / 真实测评 / 避雷 / 平替 | 太专业的医学术语 | | **抖音 DY** | 泛娱乐 / 下沉 / 场景化 | 医生科普 / 剧情 / 对比视频 | 长尾冷门 kw | | **京东 JD** | 理性决策 / 对比选购 | 规格 / 价格 / 效果 / 副作用 | 情感化 kw | | **天猫 TM** | 品牌忠诚 / 复购 | 品牌名 + 人群(男士/儿童) | 通用 kw | | **Amazon 海外** | 跨境 / 英文 | milk thistle / kids probiotics / liver detox | 中文品牌名 | | **微博 Weibo** | 热点 / KOL 爆发 | 明星话题 + 品类 | 长尾 | **同一假设的跨平台 kw 示例**: | 假设 | XHS | DY | JD | Amazon | |---|---|---|---|---| | H1 护肝片痛点 | "护肝片真的有用吗" | "护肝片伤肝" | "护肝片 副作用" | "milk thistle side effects" | | H3 儿童便秘刚需 | "宝宝便秘" | "宝宝便秘调理" | "儿童便秘 药" | "kids constipation" | --- ### 框架 D · 每 kw 条数设计 ```js // 在 collect.js 的 BATCHES 定义里 BATCHES[1].xhs = [ { keyword: '江中乳酸菌素片', max_notes: 15, max_comments_per: 10 }, { keyword: '妈咪爱', max_notes: 12, max_comments_per: 8 }, // ... ]; ``` **标准配置**: | 类型 | max_notes | max_comments_per | 预期 item | |---|---|---|---| | 本品直搜(高权重) | 15-20 | 8-15 | 80-150 | | 头部竞品 | 10-15 | 6-10 | 50-100 | | 场景痛点 | 8-12 | 5-8 | 30-60 | | 长尾/相邻 | 6-10 | 3-6 | 15-40 | **总量目标**: - 5000 万目标项目 → **≥ 1500 条** - 1-3 亿目标项目 → **≥ 2500 条** - 10 亿目标项目 → **≥ 4000 条** --- ## 📋 `3.采集矩阵.md` 必写清单 ### 开篇 · 采集目标(1 节) 1. ☐ 目标总量(条) 2. ☐ 目标覆盖平台数 3. ☐ 预期耗时(分钟) ### 关键词矩阵(1 节 · 大表) ```markdown | 象限 | 关键词 | 平台 | 批次 | max_notes | 关联假设 | |---|---|---|---|---|---| | I 本品 | 江中乳酸菌素片 | XHS | B1 | 15 | H1+H2+H3 | | II 头部 | 妈咪爱 | XHS | B1 | 12 | H1+H5 | | ... | ... | ... | ... | ... | ... | ``` ### 批次执行计划(3 节) - Batch 1: P0 kw 清单 + 预期产出 + 预估时间 - Batch 2: P1 kw 清单 + 前置条件(B1 必须完成) - Batch 3: P2 kw 清单 + 触发条件(某假设 VOC 不足则补采) ### 假设覆盖验证表(1 节) ```markdown | 假设 | 覆盖 kw | 预期条数 | 备注 | |---|---|---|---| | H1 | 妈咪爱, 亿活, 金双岐, 宝乐安 | ≥ 250 | 4 kw | | H2 | 合生元, 万益蓝, 拜奥, 康萃乐, inne | ≥ 250 | 5 kw | | ... | | | | ``` ### 回路触发(1 节) ```markdown | 触发条件 | 追加 kw | 放入批次 | |---|---|---| | H6 < 100 条 | 儿童无糖, 宝宝包装, 好看包装 | B4(补采) | | H7 < 50 条 | 告别瓶瓶罐罐, DHA 软糖 | B4(补采) | ``` --- ## 🛠️ 实操建议 ### 建议 1 · 关键词先写中文再去平台验证 先在 markdown 里头脑风暴 40-50 个 kw,然后**逐个在平台手动搜一下**: - 如果结果页前 10 条笔记和 VOC 主题相关 ✅ 保留 - 如果结果页全是不相关内容 ❌ 删除或换词 例如「儿童益生菌推荐」在 XHS 结果都是带货软文 → 换成「**宝宝益生菌怎么选**」效果好很多。 ### 建议 2 · 头部竞品不要只选自认为的第 1 名 实战发现:**客户方认为的 #1 竞品经常不是 VOC 最多的**。 - 乳酸菌项目:客户以为主要对手是合生元,但 VOC 吐槽最多的是妈咪爱(药品线) - 肝纯片项目:客户以为主要对手是 Swisse,但 VOC 吐槽最多的是易善复(处方壁垒) **解决方案**:P3 里列 **3-5 个候选头部竞品**,P4 Batch 1 都先采一点,看哪个 VOC 最集中再扩展。 ### 建议 3 · 场景 kw 要写"人称+场景" ❌ 差:「便秘」(太宽,大量成人便秘 VOC 不相关) ✅ 好:「**宝宝便秘**」「**儿童便秘**」(锁定儿童场景) ❌ 差:「积食」 ✅ 好:「**孩子积食**」「**宝宝积食调理**」 ### 建议 4 · 相邻赛道 kw 做跨品类比较 例如乳酸菌的 H7「告别瓶瓶罐罐」: - kw 1:`儿童营养软糖` → 反映家长给孩子吃多少瓶 - kw 2:`儿童补钙` → 反映钙剂市场的重复消费 - kw 3:`儿童 DHA` → 反映 DHA 市场 - kw 4:`瓶瓶罐罐` → 直接反映家长抱怨(高信号词) 这 4 个 kw 加起来就构成 H7 的证据池(601 条 / 乳酸菌项目)。 --- ## 🚫 常见失误 ### 失误 1 · 关键词太宽 - ❌ 差:`益生菌`(搜 XHS 几十万篇笔记,采出来的 VOC 不聚焦) - ✅ 好:`儿童益生菌` / `宝宝益生菌` / `妈咪爱` / `合生元益生菌` ### 失误 2 · 漏掉场景痛点类 - ❌ 差:只采品牌名(本品 + 竞品) - ✅ 好:品牌名占 60%,**场景痛点 20%**,**相邻/长尾 20%** ### 失误 3 · 所有 kw 的 max_notes 一样 - ❌ 差:所有 kw 都 max_notes=10(本品数据不够 / 长尾数据浪费) - ✅ 好:本品 15-20 / 头部 10-15 / 场景 8-12 / 长尾 6-10 ### 失误 4 · 忘记"回路触发" - ❌ 差:P3 一次写死,跑完就算 - ✅ 好:P3 预留 Batch 4(补采),触发条件明确(H6 < 100 条等) --- ## ✅ 退出门控 Phase 3 完成的 **5 个条件**: 1. ☐ 关键词矩阵 **30-50 kw** 全部列明 2. ☐ **每条 H 假设**都有 **≥ 3 kw** 覆盖 3. ☐ 批次划分 **B1/B2/B3** 明确 + 预估时间 4. ☐ 平台分配明确(XHS / DY 主力,其他按需) 5. ☐ 假设覆盖表 + 回路触发表 完整 --- ## 📚 模板 + Prompt - [`templates/3.采集矩阵.template.md`](./templates/3.采集矩阵.template.md) - [`prompts/P3-collection.prompt.md`](./prompts/P3-collection.prompt.md) ## 📖 案例参考 - [肝纯片](./case-studies/01-jiangzhong-liver-DMY.md) · 46 kw × 3 平台(含 Amazon) - [乳酸菌](./case-studies/03-jiangzhong-lactic-children.md) · 41 kw × 2 平台