诊断方法

为什么 ChatGPT 更常推荐你的竞争对手

一次回答只是样本,不是判决。一套可重复的方法,把一个让人不舒服的结果,变成能核对、能比较、能动手的观察,再变成下一步动作。

先说结论

  • 同一个问题问两次,名单经常不一样。这是系统按设计在运行,不是有人在暗中扣你的分。
  • 统计之前,先把每条回答分成四类:被推荐、被列出、带保留地提到、完全没出现。
  • 引用告诉你回答旁边展示了哪一页,但不告诉你这一页造成了这次回答。3
  • 第一步应该落在你自己拥有的页面上。第三方的事放在后面,而且永远不靠买。4

一次回答只是一个样本

如果你曾经问过助手关于自己品类的问题,眼看着竞争对手被点名、而你的产品没有出现,第一反应是把那次回答当成判决。它不是。它只是一个随机系统产出的样本——一种语言、一个市场、一个瞬间,面对的是那一秒存在的搜索索引。

OpenAI 的搜索文档把这件事说得很直白:搜索结果和引用可能不完整、过时或不准确。3独立的测量从外部得出同一个结论:针对生成式搜索平台的重复采样研究发现,完全相同的问题会返回不同的回答、引用不同的来源,引用分布极度倾斜,被引域名的排序在不同样本之间并不稳定——不只在头部,而是贯穿整个高频被引集合。1

实际晃到什么程度?一篇关于重复查询审计的方法论文报告,品牌推荐测量的信度系数约为:5 次重复 0.58,10 次 0.74,15 次 0.81。2这说明单次运行最多只是「快速看一眼」。下面整套方法,就是为了把几个样本压缩成少数几条你真正能拿去辩护的结论。

先写问题,再看回答

最容易骗到自己的做法,是先看到哪些问题自己赢了、再回头写问题;或者只写一个宽泛的问题(比如「适合创业公司的最佳 CRM」),然后把它的回答当成整个市场。买家的问题分成几类,而每一类会浮现出不同的竞品名单。

问题类型例子它告诉你什么
发现型十五人的软件公司,用什么 CRM 最合适?买家还没有候选清单时,谁会被点名
对比型甲产品 与 乙产品,八人团队选哪个在正面比较的框架里谁占上风
替代型小团队想换掉现有平台,有哪些替代方案谁掌握着「换工具」这个话题
预算或约束型便宜、但要有真正可用的接口的电子签约工具在买家那个价位上,你有没有资格参与
场景型自由职业者要按两种货币开票,该用什么工具你有没有被绑定到某个具体任务上

把每条回答分成四类

在统计任何数字之前,先给回答里实际发生的事归类。推荐和提及之间的那道缝,正是多数仪表盘悄悄误导人的地方。

  • 被推荐——回答把这个品牌作为所问问题的可选项呈现出来。
  • 被列出——名字出现在名单或顺带一提里,但没有被当作选项给出来。
  • 带保留地提到——品牌旁边跟着一个限制、一句提醒,或者一个「不过」。
  • 完全没出现——品牌在回答里根本没有出现。

搞清楚竞争对手究竟赢在哪里

公司层面的声量份额会盖掉问题的结构。在对比型问题上通吃、在发现型问题里从不出现的对手,和处处领先的对手,弱点不一样,改法也不一样。

先按问题类型分组,再读回答用了什么措辞。回答往往会往某个品牌身上挂一个具体属性:集成深度、上手时间、价格下限、合规立场、生态规模。那个属性,才是你该回自己网站上找的东西。

这一步也是团队最容易直接跳到「我们得多写内容」的地方。先多等一步。如果回答奖励的那个属性你站上其实已经写了,只是写在图片里、或者只在可下载的文档里——那你的问题是格式,不是数量。

给你能打开的来源分类

只有使用了联网搜索的回答,才会给你可以打开的链接。没有链接的回答,什么都无法核对,它的措辞也不能归因到某一张具体的训练网页。3

对能打开的那些,先分类再决定动作。每一类对应不同的应对方式,而五类里有两类根本不值得追。

来源类别能支撑什么不能支撑什么
你自己拥有的页面你发布的事实:品类、客户、限制、证明有没有别人注意到
独立目录或评测站有运营者把你归进了某个类目这份收录是否准确、是否最新
社区帖有人在讨论这个问题任何你能主导的情绪
行业媒体或新闻有出版物认为这件事值得报道任何你能合法买到的东西
竞争对手的对比页对手正在定义这个品类任何你能控制的东西

把「看到的」和「猜的」分开

留两栏,并且永远不要让它们合并。左栏放观察:原文引用、来源链接、运行条件、日期。右栏放你对它的解释,并明确标为解释。

观察推断
二十条回答里的第七条,竞争对手被排在第一个,描述是「最适合小团队」。模型把那家品牌和小团队绑在了一起。
在安装配置那个问题上,对手的帮助中心页面排在我们前面。对手的文档被认为更完整。
所有运行里,没有任何一条回答提到我们的价格页。我们的价格信息可能不好提取,也可能根本不在被抓取到的页面集合里。

按证据强度和可控性排序

把候选动作分成三层,按顺序做。人的本能是先挑听起来最「战略」的那一层,但那一层恰恰最慢、也最不受你控制。

  • 第一层,你自己拥有的页面。如果回答在奖励某项属性,而你自己的页面和它矛盾、干脆没写、或者埋在图片里,那就在动手做别的之前先修这里。它快、属于你、而且改动可验证。
  • 第二层,你有资格更正的第三方事实——类目归错的目录收录、过时的价格标注、改了名却没人更新的产品页。先读发布方自己的规则,只提交准确的更正。4
  • 第三层,独立的媒体报道或专家内容。这一层最慢、买不到,而且只有当你确实在做一件值得被描述的事时才成立。

什么时候不该下结论

一套从不说「停」的方法不算方法。下面这些情况下,诚实的结论就是「无法判定」。

  • 完全没有引用。你手上只有一个模型某次行为,没有任何可核对的东西。就照实这么说。
  • 样本量撑不住你看到的波动。如果每次问同一个问题名单都在变,那你测到的是噪声。
  • 条件变了。模型更新、换了市场、或者搜索开关前后不同,这些都会重置基线,而不是体现改进。
  • 被要求写成一个故事。如果对方要的是结论被确认,而不是被检验,那就该说不。

然后,再跑一遍

改动做完之后,用完全相同的问题集、在完全相同的条件下再跑一次。如果数字变了,先问一句:是不是测量方式变了。受控的比较能支撑一个关于清晰度和证据的真实决定;它没法保证某个助手一定会推荐你。

我们自己的报告把第一层的工作归纳成三个方向:把品类和理想客户明确写出来;发布真正有用的对比内容,并且把自己产品的限制也写进去;强化外人可以验证的公开证明。请把它们当作值得权衡的方向,而不是处方。到底哪一个对你的市场重要,应该由你收集到的证据来决定。