购买前的疑问

AI 可见度工具说的「支持多个平台」,到底指什么

「支持 6 个平台」是最容易拿来比、也最容易说得含糊的一句话。把「平台覆盖」当筛选条件之前,先问清楚这几件事。

先说结论

  • 「平台覆盖」其实是三件事:能问它、存下完整回答、把不同平台的结果摆到同一根轴上比。多数厂商页面只承诺了第一件。
  • 跨平台分数是最难做诚实的那一块,因为同一个问题在不同助手上,拿回来的引用集合根本不可比。
  • 别问它列了哪些平台,问它存了什么。表格里的一个平台名,和一条你下个月还能翻出来重读的回答,不是一回事。
  • 一个平台做深,和六个平台各做浅,回答的是两个不同的问题。没有哪个天然更好——挑匹配你手上那个决策的。

同一句话,可能是三种不同的产品

「我们支持 ChatGPT、Perplexity、Gemini、Claude、Copilot 和 Google AI。」这句话在这个品类的厂商页面上随处可见,而同一句话可以描述三种相当不同的产品。

它可能指:工具能把问题发给这几个服务,然后把回答显示给你看。也可能指:它把完整回答原文和引用页面都存下来了,你一个月后还能翻出来重读。还可能指:它把你的表现放在这几个平台之间做比较——这是比前两种大得多的一个声明。1

  • 问了:问题发出去了,回答回来了。
  • 存了:回答原文、模型、日期和被引用的 URL 都留下了。
  • 能比:不同平台的结果被摆到同一套口径下,而且厂商解释了他们怎么处理「各平台答得不一样」这件事。
  • 只有第三种需要那个解释。前两种不需要。

为什么跨平台的数字对不齐

一项横跨 Perplexity、OpenAI 的搜索产品和 Google Gemini 的引用行为采样研究发现:引用分布呈幂律形态,而且在重复采样之间波动明显。同一个测量问题,拿去问不同平台,得到的不是一组可以摆在同一根轴上的数字。1

这不代表跨平台追踪没用。它代表一个「没解释过口径」的跨平台分数没用——这是个更窄、更具体的问题,也是任何一个「综合分数」摆到你面前时都该问一句的事。

深和广,回答的是两个不同的问题

覆盖六个平台的工具,通常在每个平台上只跑少量问题。只覆盖一个平台的工具,跑得起更多问题、存得下更多回来的东西,还能按计划重复同一组问题。两种都是合理的产品,只是回答的东西不一样。

  • 广度回答的是:我的可见度在不同助手之间,形状有什么差别?
  • 深度回答的是:我这组问题上的数字稳不稳,两次运行之间变了什么?
  • 广度把预算摊到平台上,深度把预算花在重复上。
  • 搞清楚这两个问题里哪个是你的,决定就做完了大半。

比较覆盖范围之前,先问这六个问题

如果厂商页面只列了平台名,没说明它做的是上面三种声明里的哪一种,一封邮件把这几个问题问过去,就能拿到能用的答案。

  • 今天真正在线上跑的是哪几个平台,哪几个只是在路线图上?请对方把两份名单分开写清楚。
  • 对每个平台,工具存的是完整回答,还是只有一个分数?
  • 结果是按平台分别记录,还是合并成了一个数字?
  • 每个平台多久查一次,能不能按需重跑一组固定问题?
  • 如果有一个跨平台的综合数字,它是怎么归一化的?
  • 平台换了模型之后,你之前的运行记录会怎么样?

我们自己怎么做,直说

AI荐谁只检查 ChatGPT。Perplexity、Gemini、Claude、Copilot 和 Google AI 目前都不支持,也没有公布任何上线日期。

检查走的是 ChatGPT 自己那条可联网搜索的路径,所以记下来的是回答、产生回答的模型,以及随回答一起返回的公开页面。3 至于那些页面能不能被读到,取决于公开的爬虫规则,值得在把「引用缺失」怪到工具头上之前先读一遍。2

覆盖窄,也是它能存下完整回答原文、保留引用页面、并且在 Pro 方案上按计划重复同一组问题的原因之一——而不是把同样的力气摊在六个不断变动的目标上。

如果你的决策依赖「把几个助手放在一起比」,那它不是干这个的工具。上面那份清单大概五分钟就能让你确认这一点,比过了账单周期才知道要便宜。

说得具体的覆盖声明长什么样

覆盖声明通常都很含糊,因为含糊更安全。但说得具体的那种很好认,而且就算你已经决定要买了,也值得逼对方写出来。

一个真能拿去核对的回答长这样:点名平台、说清存了什么、交代频率、并且说明没覆盖什么——而且这些东西要出现在同一段里,而不是拆成一张功能表外加一条脚注。

  • 点名:「ChatGPT,走可联网搜索那条路径,每天检查。」
  • 存了什么:「完整回答原文、模型版本、运行时间戳,以及每一条被引用的 URL。」
  • 频率:「同一组问题可以按需重跑;定时重复在最高一档方案提供。」
  • 没覆盖什么:「Perplexity、Gemini 和 Copilot 不支持,也没有公布上线日期。」
  • 不确定什么:「单次运行分不出数字只差几个点的两个品牌。」

怎么自己判断

先把决策写下来。如果是「我们该优先做哪个助手」,你需要的是广度,并且要预先接受每个平台都只是浅测。如果是「关于我们品类的这个具体说法稳不稳,我们改完页面之后它动没动」,你需要的是深度,一个平台就够回答。

最容易踩的坑,是拿广度去买深度问题的答案。这个坑很好踩,因为广度写在表格里好看得多。