证据清单

什么样的 AI 可见度证据,才算可核验

区分提及、推荐、引用和可见度分数,了解如何通过保存原始回答、核对公开来源和重复检查,让 AI 可见度结论可以复核。

先说结论

  • 分数的含金量,取决于它背后的问题集和记录。这两样都要看。
  • 无法复核的记录,只是一个配了故事的数字,不是证据。
  • 任何一批记录,都要人工重读大约四分之一。如果厂商不愿意配合这件事,这份不愿意本身就是发现。
  • 同一个问题跑两次永远不会完全一致。所以给区间,不要给固定名次。

四个不同的观察,被同一个词糊在一起

买方和卖方都把这四个词当成可以互换的说法,于是一个很弱的测量就这样被当成强证据卖出去。它们不是同义词,OpenAI 自己的文档也把「联网搜索的回答会展示什么」和「它能证明什么」分得很清楚。1

说法含义不等于
提及品牌名出现在回答的某处回答把它当作一个选项给了出来
推荐回答把这个品牌作为所问问题的可选项呈现有人会因此行动
引用回答旁边给出一条可打开的链接这一页造成了这次回答
可见度分数某个确定问题集内品牌出现频率的汇总该问题集之外的任何情况

能被复核的记录包含九项内容

如果你没法还原「这条记录为什么被算进来」,那你手上就是一个配了故事的数字。付费之前,先要一条完整的原始记录来看看。它应当包含以下全部内容。

  • 原样的问题文字,包括挂在它上面的任何限定条件。
  • 模型,以及它的版本或模式。
  • 这一次运行有没有开放联网搜索。
  • 带时区的日期与时间。
  • 语言与市场——这两项会实质性地改变回答。
  • 完整的回答原文,不是摘要,也不是截图。
  • 出现了哪些品牌,以及每一个是怎么被归类的。
  • 模型在这一次回答里带回的全部来源链接。
  • 一种导出或打印这条记录的方式,让工具之外的人也能读。

购买前要问的十二个问题

这几个问题能把「测量工具」和「仪表盘」分开。请用书面方式问,并把答案留下来——半年后你还会用到它们。

  • 一、问题集我能自己改吗?
  • 二、完整回答原文有没有留存,还是只有一个分数?
  • 三、提及、推荐、引用是不是被当作不同的观察分别报告?
  • 四、每条回答有没有附上模型带回的来源链接?
  • 五、竞品结果是按单个问题拆开的,还是只有汇总?
  • 六、每次运行有没有记录模型、语言、市场和搜索开关?
  • 七、底层记录我能导出吗?
  • 八、包含多少次重复运行?多加一次要多少钱?
  • 九、报告的是不确定性,还是一个单一的点估计?
  • 十、历史数据保留多久?如果我取消订阅会怎样?
  • 十一、你们自己的宣传语里,哪些是经过独立核验的?
  • 十二、你们不做哪些事?一个说不出自己边界的厂商,通常没想过边界在哪。

抽四分之一人工复核

自动分类会漂移,尤其在语义含糊的句子上——比如品牌被称赞了,但并没有被当作选项给出来。抽样复核能抓住大部分漂移,而且比多数人预想的更快。

有两个习惯决定成败。第一,抽样要刻意设计,而不是挑最容易看到的记录读:每种问题类型至少一条,每个竞品至少一条。第二,先定通过标准再开始读,免得最后做决定的人变成那个在为仪表盘辩护的人。

  • 重读那条回答,确认每个品牌的归类和一位认真的人会给出的归类一致。
  • 打开每一条来源链接,确认它能打开,并且支持它旁边的那句话。
  • 确认运行条件是当时记录下来的,而不是事后补的。
  • 留意修饰语:『适合』『不过』『更便宜但』——这些从句正是推荐变弱的地方。

你什么都没改,数字照样会动

这是「虚假的好消息」最常见的来源。重复采样研究表明,引用分布极度倾斜,被引域名的排序在不同样本之间并不稳定——不只是头部,而是贯穿整个高频被引集合。2很多两个域名之间看起来明显的差别,就落在测量自身的噪声底线里。

一篇关于重复查询审计的方法论文,量化了省掉重复的代价:5 次重复的信度约 0.58,10 次约 0.74,15 次约 0.81。3这意味着:五次是快速看一眼,十五次才算说得过去的一条记录;而几个百分点的波动,通常根本不是发现。

还有第二个会动的部件,靠重复次数是修不好的:模型自己会变。能固定就固定模型和模式;一旦模型换了,就把它当成一条新基线,而不是旧趋势的延续。

值得当真的危险信号

下面任何一条,都值得直接追问。三条同时出现,通常说明这个产品说不出它宣称能说的事。

  • 只有一个总分,看不出背后的回答。
  • 把提及写成推荐,或者把旁边的一条引用写成证据。
  • 运行条件不披露,或者只有「最后更新」四个字却没有日期。
  • 没有历史,每份报告都是一张无法比较的快照。
  • 不能导出——这让独立核对在设计上就不可能。
  • 把排名当成固定名次呈现,完全不提采样波动。
  • 话术暗示「照这条路走就能被推荐」。

AI荐谁记录了哪些字段,哪些没有

同一套标准也得用在我们自己身上,所以这里逐项列出。没有提供的,就明写没有提供,而不是留给人去猜。

字段状态说明
问题集已记录生成后交由你审核,或手动录入;启用中的问题才会参与一次运行
模型与模式已记录固定使用同一个可联网搜索的模型,每次运行标注,并限制搜索调用次数
语言已记录审计跟随账户语言,问题集也用该语言撰写
完整回答原文已记录随每次审计运行一起保存,也是分类判断的依据
提及与推荐分开已区分作为两种不同观察分别归类,并同时保留模型带回的来源链接
每条回答的来源链接已记录按模型返回的原样保存;竞品自有的页面会被标注,而不会算作机会
竞品对比已记录细化到单条问题;自动发现的候选必须经你确认后才计入
历史记录视方案而定免费版不保留,Plus 保留 90 天,Pro 保留 730 天。更早的运行会被锁定,而不是删除。
原始数据导出仅 Pro 提供易读的网页报告:包含摘要、逐题结果、引用来源、可观察证据路径与行动建议,不包含完整回答原文。
不确定性区间暂不提供我们只报告某一次运行观察到什么,不发布跨重复运行的置信区间
固定搜索路径之外的平台未提供我们不测量自己并不运营的助手

之后仍用同一把尺子

真的做了改动之后,用完全相同的问题集、在完全相同的条件下再跑一次,然后把两条记录并排放。如果条件变了,就说条件变了,并且把差异当作「无法判定」,而不是当作胜利。

最后你会得到的不是一句承诺,而是一份说得清楚的交代:观察到了什么、依据是什么、还有哪些仍然不知道。这正是团队决定下一步该改什么时,真正需要的东西。