同一句话,可能是三种不同的产品
「我们支持 ChatGPT、Perplexity、Gemini、Claude、Copilot 和 Google AI。」这句话在这个品类的厂商页面上随处可见,而同一句话可以描述三种相当不同的产品。
它可能指:工具能把问题发给这几个服务,然后把回答显示给你看。也可能指:它把完整回答原文和引用页面都存下来了,你一个月后还能翻出来重读。还可能指:它把你的表现放在这几个平台之间做比较——这是比前两种大得多的一个声明。1
- 问了:问题发出去了,回答回来了。
- 存了:回答原文、模型、日期和被引用的 URL 都留下了。
- 能比:不同平台的结果被摆到同一套口径下,而且厂商解释了他们怎么处理「各平台答得不一样」这件事。
- 只有第三种需要那个解释。前两种不需要。
为什么跨平台的数字对不齐
一项横跨 Perplexity、OpenAI 的搜索产品和 Google Gemini 的引用行为采样研究发现:引用分布呈幂律形态,而且在重复采样之间波动明显。同一个测量问题,拿去问不同平台,得到的不是一组可以摆在同一根轴上的数字。1
这不代表跨平台追踪没用。它代表一个「没解释过口径」的跨平台分数没用——这是个更窄、更具体的问题,也是任何一个「综合分数」摆到你面前时都该问一句的事。
深和广,回答的是两个不同的问题
覆盖六个平台的工具,通常在每个平台上只跑少量问题。只覆盖一个平台的工具,跑得起更多问题、存得下更多回来的东西,还能按计划重复同一组问题。两种都是合理的产品,只是回答的东西不一样。
- 广度回答的是:我的可见度在不同助手之间,形状有什么差别?
- 深度回答的是:我这组问题上的数字稳不稳,两次运行之间变了什么?
- 广度把预算摊到平台上,深度把预算花在重复上。
- 搞清楚这两个问题里哪个是你的,决定就做完了大半。
比较覆盖范围之前,先问这六个问题
如果厂商页面只列了平台名,没说明它做的是上面三种声明里的哪一种,一封邮件把这几个问题问过去,就能拿到能用的答案。
- 今天真正在线上跑的是哪几个平台,哪几个只是在路线图上?请对方把两份名单分开写清楚。
- 对每个平台,工具存的是完整回答,还是只有一个分数?
- 结果是按平台分别记录,还是合并成了一个数字?
- 每个平台多久查一次,能不能按需重跑一组固定问题?
- 如果有一个跨平台的综合数字,它是怎么归一化的?
- 平台换了模型之后,你之前的运行记录会怎么样?
我们自己怎么做,直说
AI荐谁只检查 ChatGPT。Perplexity、Gemini、Claude、Copilot 和 Google AI 目前都不支持,也没有公布任何上线日期。
检查走的是 ChatGPT 自己那条可联网搜索的路径,所以记下来的是回答、产生回答的模型,以及随回答一起返回的公开页面。3 至于那些页面能不能被读到,取决于公开的爬虫规则,值得在把「引用缺失」怪到工具头上之前先读一遍。2
覆盖窄,也是它能存下完整回答原文、保留引用页面、并且在 Pro 方案上按计划重复同一组问题的原因之一——而不是把同样的力气摊在六个不断变动的目标上。
如果你的决策依赖「把几个助手放在一起比」,那它不是干这个的工具。上面那份清单大概五分钟就能让你确认这一点,比过了账单周期才知道要便宜。
说得具体的覆盖声明长什么样
覆盖声明通常都很含糊,因为含糊更安全。但说得具体的那种很好认,而且就算你已经决定要买了,也值得逼对方写出来。
一个真能拿去核对的回答长这样:点名平台、说清存了什么、交代频率、并且说明没覆盖什么——而且这些东西要出现在同一段里,而不是拆成一张功能表外加一条脚注。
- 点名:「ChatGPT,走可联网搜索那条路径,每天检查。」
- 存了什么:「完整回答原文、模型版本、运行时间戳,以及每一条被引用的 URL。」
- 频率:「同一组问题可以按需重跑;定时重复在最高一档方案提供。」
- 没覆盖什么:「Perplexity、Gemini 和 Copilot 不支持,也没有公布上线日期。」
- 不确定什么:「单次运行分不出数字只差几个点的两个品牌。」
怎么自己判断
先把决策写下来。如果是「我们该优先做哪个助手」,你需要的是广度,并且要预先接受每个平台都只是浅测。如果是「关于我们品类的这个具体说法稳不稳,我们改完页面之后它动没动」,你需要的是深度,一个平台就够回答。
最容易踩的坑,是拿广度去买深度问题的答案。这个坑很好踩,因为广度写在表格里好看得多。