一次回答只是一个样本
如果你曾经问过助手关于自己品类的问题,眼看着竞争对手被点名、而你的产品没有出现,第一反应是把那次回答当成判决。它不是。它只是一个随机系统产出的样本——一种语言、一个市场、一个瞬间,面对的是那一秒存在的搜索索引。
OpenAI 的搜索文档把这件事说得很直白:搜索结果和引用可能不完整、过时或不准确。3独立的测量从外部得出同一个结论:针对生成式搜索平台的重复采样研究发现,完全相同的问题会返回不同的回答、引用不同的来源,引用分布极度倾斜,被引域名的排序在不同样本之间并不稳定——不只在头部,而是贯穿整个高频被引集合。1
实际晃到什么程度?一篇关于重复查询审计的方法论文报告,品牌推荐测量的信度系数约为:5 次重复 0.58,10 次 0.74,15 次 0.81。2这说明单次运行最多只是「快速看一眼」。下面整套方法,就是为了把几个样本压缩成少数几条你真正能拿去辩护的结论。
先写问题,再看回答
最容易骗到自己的做法,是先看到哪些问题自己赢了、再回头写问题;或者只写一个宽泛的问题(比如「适合创业公司的最佳 CRM」),然后把它的回答当成整个市场。买家的问题分成几类,而每一类会浮现出不同的竞品名单。
| 问题类型 | 例子 | 它告诉你什么 |
|---|---|---|
| 发现型 | 十五人的软件公司,用什么 CRM 最合适? | 买家还没有候选清单时,谁会被点名 |
| 对比型 | 甲产品 与 乙产品,八人团队选哪个 | 在正面比较的框架里谁占上风 |
| 替代型 | 小团队想换掉现有平台,有哪些替代方案 | 谁掌握着「换工具」这个话题 |
| 预算或约束型 | 便宜、但要有真正可用的接口的电子签约工具 | 在买家那个价位上,你有没有资格参与 |
| 场景型 | 自由职业者要按两种货币开票,该用什么工具 | 你有没有被绑定到某个具体任务上 |
把每条回答分成四类
在统计任何数字之前,先给回答里实际发生的事归类。推荐和提及之间的那道缝,正是多数仪表盘悄悄误导人的地方。
- 被推荐——回答把这个品牌作为所问问题的可选项呈现出来。
- 被列出——名字出现在名单或顺带一提里,但没有被当作选项给出来。
- 带保留地提到——品牌旁边跟着一个限制、一句提醒,或者一个「不过」。
- 完全没出现——品牌在回答里根本没有出现。
搞清楚竞争对手究竟赢在哪里
公司层面的声量份额会盖掉问题的结构。在对比型问题上通吃、在发现型问题里从不出现的对手,和处处领先的对手,弱点不一样,改法也不一样。
先按问题类型分组,再读回答用了什么措辞。回答往往会往某个品牌身上挂一个具体属性:集成深度、上手时间、价格下限、合规立场、生态规模。那个属性,才是你该回自己网站上找的东西。
这一步也是团队最容易直接跳到「我们得多写内容」的地方。先多等一步。如果回答奖励的那个属性你站上其实已经写了,只是写在图片里、或者只在可下载的文档里——那你的问题是格式,不是数量。
给你能打开的来源分类
只有使用了联网搜索的回答,才会给你可以打开的链接。没有链接的回答,什么都无法核对,它的措辞也不能归因到某一张具体的训练网页。3
对能打开的那些,先分类再决定动作。每一类对应不同的应对方式,而五类里有两类根本不值得追。
| 来源类别 | 能支撑什么 | 不能支撑什么 |
|---|---|---|
| 你自己拥有的页面 | 你发布的事实:品类、客户、限制、证明 | 有没有别人注意到 |
| 独立目录或评测站 | 有运营者把你归进了某个类目 | 这份收录是否准确、是否最新 |
| 社区帖 | 有人在讨论这个问题 | 任何你能主导的情绪 |
| 行业媒体或新闻 | 有出版物认为这件事值得报道 | 任何你能合法买到的东西 |
| 竞争对手的对比页 | 对手正在定义这个品类 | 任何你能控制的东西 |
把「看到的」和「猜的」分开
留两栏,并且永远不要让它们合并。左栏放观察:原文引用、来源链接、运行条件、日期。右栏放你对它的解释,并明确标为解释。
| 观察 | 推断 |
|---|---|
| 二十条回答里的第七条,竞争对手被排在第一个,描述是「最适合小团队」。 | 模型把那家品牌和小团队绑在了一起。 |
| 在安装配置那个问题上,对手的帮助中心页面排在我们前面。 | 对手的文档被认为更完整。 |
| 所有运行里,没有任何一条回答提到我们的价格页。 | 我们的价格信息可能不好提取,也可能根本不在被抓取到的页面集合里。 |
按证据强度和可控性排序
把候选动作分成三层,按顺序做。人的本能是先挑听起来最「战略」的那一层,但那一层恰恰最慢、也最不受你控制。
- 第一层,你自己拥有的页面。如果回答在奖励某项属性,而你自己的页面和它矛盾、干脆没写、或者埋在图片里,那就在动手做别的之前先修这里。它快、属于你、而且改动可验证。
- 第二层,你有资格更正的第三方事实——类目归错的目录收录、过时的价格标注、改了名却没人更新的产品页。先读发布方自己的规则,只提交准确的更正。4
- 第三层,独立的媒体报道或专家内容。这一层最慢、买不到,而且只有当你确实在做一件值得被描述的事时才成立。
什么时候不该下结论
一套从不说「停」的方法不算方法。下面这些情况下,诚实的结论就是「无法判定」。
- 完全没有引用。你手上只有一个模型某次行为,没有任何可核对的东西。就照实这么说。
- 样本量撑不住你看到的波动。如果每次问同一个问题名单都在变,那你测到的是噪声。
- 条件变了。模型更新、换了市场、或者搜索开关前后不同,这些都会重置基线,而不是体现改进。
- 被要求写成一个故事。如果对方要的是结论被确认,而不是被检验,那就该说不。
然后,再跑一遍
改动做完之后,用完全相同的问题集、在完全相同的条件下再跑一次。如果数字变了,先问一句:是不是测量方式变了。受控的比较能支撑一个关于清晰度和证据的真实决定;它没法保证某个助手一定会推荐你。
我们自己的报告把第一层的工作归纳成三个方向:把品类和理想客户明确写出来;发布真正有用的对比内容,并且把自己产品的限制也写进去;强化外人可以验证的公开证明。请把它们当作值得权衡的方向,而不是处方。到底哪一个对你的市场重要,应该由你收集到的证据来决定。