03-phase3-collection-planning.md 8.9 KB

Phase 3 · 采集规划 Collection Planning

把 H1-H8 假设 → 关键词 × 平台 × 批次 矩阵 —— 决定接下来 50-120 分钟的 API 调度。


🎯 目标

输入:P2 的 VOC 思路文档(含 8 假设 + 竞品地图)
输出docs/<品类>/3.采集矩阵.md,包含:

  1. 30-50 关键词 × 2-3 批次(P0/P1/P2 优先级)
  2. 2-6 平台的关键词映射(不同平台有不同热词)
  3. 每 kw 预期条数(指导 API max_items
  4. 假设覆盖表(验证每条 H 都有 ≥ 3 kw 覆盖)

🔑 核心框架

框架 A · 关键词四象限

每个品类的关键词应该覆盖 4 个象限:

                   本品 ←──────────→ 对立品
                    │                 │
                    │                 │
           头部 ────┼─ 象限 I ─┼── 象限 II
                    │  本品直搜  │  头部竞品
                    │           │
                    │ 象限 III  │ 象限 IV
                    │  场景痛点  │  长尾 / 相邻
           长尾 ────┴───────────┴──────
象限 例子(乳酸菌素片儿童版) 预期条数
I · 本品直搜 江中乳酸菌素片 · 江中乳酸菌素片儿童 · 乳酸菌素片 每 kw 60-100 条
II · 头部竞品 妈咪爱 · 合生元益生菌 · 亿活 儿童 · 拜奥 · 金双岐 每 kw 50-80 条
III · 场景痛点 宝宝便秘 · 宝宝积食 · 宝宝腹泻 · 儿童挑食 · 抗生素 益生菌 每 kw 40-60 条
IV · 长尾/相邻 inne 噗噗宝 · 康萃乐 · 万益蓝 · 儿童营养软糖 · 瓶瓶罐罐 每 kw 20-50 条

合理比例:30% I + 30% II + 20% III + 20% IV
(本品 + 头部竞品共占 60%,保证数据基础)


框架 B · 批次设计(P0 / P1 / P2)

为什么要分批

  • API 有 rate limit,一次跑完 50 关键词容易失败
  • 分批可以边采边分析,发现 VOC 不足及时补采
  • 出错后只需要重跑单一批次

三批次标准划分

批次 内容 kw 数 预期耗时 何时跑
P0 Batch 1 本品 + 头部竞品(象限 I + II) 12-18 20-30 分钟 先跑,确保基础盘
P1 Batch 2 次级竞品 + 核心场景(象限 II 尾 + III) 10-15 15-25 分钟 等 B1 跑完评估后
P2 Batch 3 长尾 + 决策 + 相邻(象限 IV) 10-15 12-20 分钟 B2 跑完后补齐 H6/H7/H8

实战参考(乳酸菌项目):

  • Batch 1: 11 XHS + 5 DY = 16 kw, 20 分钟
  • Batch 2: 10 XHS + 3 DY = 13 kw, 15 分钟
  • Batch 3: 10 XHS + 2 DY = 12 kw, 12 分钟
  • 总计:31 XHS + 10 DY = 41 kw / ~50 分钟 / 2566 真实评论

框架 C · 多平台关键词映射

不同平台有不同的用户表达习惯,同一假设要换用不同的热词:

平台 用户特点 关键词偏好 避免
小红书 XHS 新手妈妈 / 年轻女性 / 种草 日常 / 真实测评 / 避雷 / 平替 太专业的医学术语
抖音 DY 泛娱乐 / 下沉 / 场景化 医生科普 / 剧情 / 对比视频 长尾冷门 kw
京东 JD 理性决策 / 对比选购 规格 / 价格 / 效果 / 副作用 情感化 kw
天猫 TM 品牌忠诚 / 复购 品牌名 + 人群(男士/儿童) 通用 kw
Amazon 海外 跨境 / 英文 milk thistle / kids probiotics / liver detox 中文品牌名
微博 Weibo 热点 / KOL 爆发 明星话题 + 品类 长尾

同一假设的跨平台 kw 示例: | 假设 | XHS | DY | JD | Amazon | |---|---|---|---|---| | H1 护肝片痛点 | "护肝片真的有用吗" | "护肝片伤肝" | "护肝片 副作用" | "milk thistle side effects" | | H3 儿童便秘刚需 | "宝宝便秘" | "宝宝便秘调理" | "儿童便秘 药" | "kids constipation" |


框架 D · 每 kw 条数设计

// 在 collect.js 的 BATCHES 定义里
BATCHES[1].xhs = [
    { keyword: '江中乳酸菌素片', max_notes: 15, max_comments_per: 10 },
    { keyword: '妈咪爱',         max_notes: 12, max_comments_per: 8 },
    // ...
];

标准配置: | 类型 | max_notes | max_comments_per | 预期 item | |---|---|---|---| | 本品直搜(高权重) | 15-20 | 8-15 | 80-150 | | 头部竞品 | 10-15 | 6-10 | 50-100 | | 场景痛点 | 8-12 | 5-8 | 30-60 | | 长尾/相邻 | 6-10 | 3-6 | 15-40 |

总量目标

  • 5000 万目标项目 → ≥ 1500 条
  • 1-3 亿目标项目 → ≥ 2500 条
  • 10 亿目标项目 → ≥ 4000 条

📋 3.采集矩阵.md 必写清单

开篇 · 采集目标(1 节)

  1. ☐ 目标总量(条)
  2. ☐ 目标覆盖平台数
  3. ☐ 预期耗时(分钟)

关键词矩阵(1 节 · 大表)

| 象限 | 关键词 | 平台 | 批次 | max_notes | 关联假设 |
|---|---|---|---|---|---|
| I 本品 | 江中乳酸菌素片 | XHS | B1 | 15 | H1+H2+H3 |
| II 头部 | 妈咪爱 | XHS | B1 | 12 | H1+H5 |
| ... | ... | ... | ... | ... | ... |

批次执行计划(3 节)

  • Batch 1: P0 kw 清单 + 预期产出 + 预估时间
  • Batch 2: P1 kw 清单 + 前置条件(B1 必须完成)
  • Batch 3: P2 kw 清单 + 触发条件(某假设 VOC 不足则补采)

假设覆盖验证表(1 节)

| 假设 | 覆盖 kw | 预期条数 | 备注 |
|---|---|---|---|
| H1 | 妈咪爱, 亿活, 金双岐, 宝乐安 | ≥ 250 | 4 kw |
| H2 | 合生元, 万益蓝, 拜奥, 康萃乐, inne | ≥ 250 | 5 kw |
| ... | | | |

回路触发(1 节)

| 触发条件 | 追加 kw | 放入批次 |
|---|---|---|
| H6 < 100 条 | 儿童无糖, 宝宝包装, 好看包装 | B4(补采) |
| H7 < 50 条 | 告别瓶瓶罐罐, DHA 软糖 | B4(补采) |

🛠️ 实操建议

建议 1 · 关键词先写中文再去平台验证

先在 markdown 里头脑风暴 40-50 个 kw,然后逐个在平台手动搜一下

  • 如果结果页前 10 条笔记和 VOC 主题相关 ✅ 保留
  • 如果结果页全是不相关内容 ❌ 删除或换词

例如「儿童益生菌推荐」在 XHS 结果都是带货软文 → 换成「宝宝益生菌怎么选」效果好很多。

建议 2 · 头部竞品不要只选自认为的第 1 名

实战发现:客户方认为的 #1 竞品经常不是 VOC 最多的

  • 乳酸菌项目:客户以为主要对手是合生元,但 VOC 吐槽最多的是妈咪爱(药品线)
  • 肝纯片项目:客户以为主要对手是 Swisse,但 VOC 吐槽最多的是易善复(处方壁垒)

解决方案:P3 里列 3-5 个候选头部竞品,P4 Batch 1 都先采一点,看哪个 VOC 最集中再扩展。

建议 3 · 场景 kw 要写"人称+场景"

❌ 差:「便秘」(太宽,大量成人便秘 VOC 不相关)
✅ 好:「宝宝便秘」「儿童便秘」(锁定儿童场景)

❌ 差:「积食」
✅ 好:「孩子积食」「宝宝积食调理

建议 4 · 相邻赛道 kw 做跨品类比较

例如乳酸菌的 H7「告别瓶瓶罐罐」:

  • kw 1:儿童营养软糖 → 反映家长给孩子吃多少瓶
  • kw 2:儿童补钙 → 反映钙剂市场的重复消费
  • kw 3:儿童 DHA → 反映 DHA 市场
  • kw 4:瓶瓶罐罐 → 直接反映家长抱怨(高信号词)

这 4 个 kw 加起来就构成 H7 的证据池(601 条 / 乳酸菌项目)。


🚫 常见失误

失误 1 · 关键词太宽

  • ❌ 差:益生菌(搜 XHS 几十万篇笔记,采出来的 VOC 不聚焦)
  • ✅ 好:儿童益生菌 / 宝宝益生菌 / 妈咪爱 / 合生元益生菌

失误 2 · 漏掉场景痛点类

  • ❌ 差:只采品牌名(本品 + 竞品)
  • ✅ 好:品牌名占 60%,场景痛点 20%相邻/长尾 20%

失误 3 · 所有 kw 的 max_notes 一样

  • ❌ 差:所有 kw 都 max_notes=10(本品数据不够 / 长尾数据浪费)
  • ✅ 好:本品 15-20 / 头部 10-15 / 场景 8-12 / 长尾 6-10

失误 4 · 忘记"回路触发"

  • ❌ 差:P3 一次写死,跑完就算
  • ✅ 好:P3 预留 Batch 4(补采),触发条件明确(H6 < 100 条等)

✅ 退出门控

Phase 3 完成的 5 个条件

  1. ☐ 关键词矩阵 30-50 kw 全部列明
  2. 每条 H 假设都有 ≥ 3 kw 覆盖
  3. ☐ 批次划分 B1/B2/B3 明确 + 预估时间
  4. ☐ 平台分配明确(XHS / DY 主力,其他按需)
  5. ☐ 假设覆盖表 + 回路触发表 完整

📚 模板 + Prompt

📖 案例参考