四个不同的观察,被同一个词糊在一起
买方和卖方都把这四个词当成可以互换的说法,于是一个很弱的测量就这样被当成强证据卖出去。它们不是同义词,OpenAI 自己的文档也把「联网搜索的回答会展示什么」和「它能证明什么」分得很清楚。1
| 说法 | 含义 | 不等于 |
|---|---|---|
| 提及 | 品牌名出现在回答的某处 | 回答把它当作一个选项给了出来 |
| 推荐 | 回答把这个品牌作为所问问题的可选项呈现 | 有人会因此行动 |
| 引用 | 回答旁边给出一条可打开的链接 | 这一页造成了这次回答 |
| 可见度分数 | 某个确定问题集内品牌出现频率的汇总 | 该问题集之外的任何情况 |
能被复核的记录包含九项内容
如果你没法还原「这条记录为什么被算进来」,那你手上就是一个配了故事的数字。付费之前,先要一条完整的原始记录来看看。它应当包含以下全部内容。
- 原样的问题文字,包括挂在它上面的任何限定条件。
- 模型,以及它的版本或模式。
- 这一次运行有没有开放联网搜索。
- 带时区的日期与时间。
- 语言与市场——这两项会实质性地改变回答。
- 完整的回答原文,不是摘要,也不是截图。
- 出现了哪些品牌,以及每一个是怎么被归类的。
- 模型在这一次回答里带回的全部来源链接。
- 一种导出或打印这条记录的方式,让工具之外的人也能读。
购买前要问的十二个问题
这几个问题能把「测量工具」和「仪表盘」分开。请用书面方式问,并把答案留下来——半年后你还会用到它们。
- 一、问题集我能自己改吗?
- 二、完整回答原文有没有留存,还是只有一个分数?
- 三、提及、推荐、引用是不是被当作不同的观察分别报告?
- 四、每条回答有没有附上模型带回的来源链接?
- 五、竞品结果是按单个问题拆开的,还是只有汇总?
- 六、每次运行有没有记录模型、语言、市场和搜索开关?
- 七、底层记录我能导出吗?
- 八、包含多少次重复运行?多加一次要多少钱?
- 九、报告的是不确定性,还是一个单一的点估计?
- 十、历史数据保留多久?如果我取消订阅会怎样?
- 十一、你们自己的宣传语里,哪些是经过独立核验的?
- 十二、你们不做哪些事?一个说不出自己边界的厂商,通常没想过边界在哪。
抽四分之一人工复核
自动分类会漂移,尤其在语义含糊的句子上——比如品牌被称赞了,但并没有被当作选项给出来。抽样复核能抓住大部分漂移,而且比多数人预想的更快。
有两个习惯决定成败。第一,抽样要刻意设计,而不是挑最容易看到的记录读:每种问题类型至少一条,每个竞品至少一条。第二,先定通过标准再开始读,免得最后做决定的人变成那个在为仪表盘辩护的人。
- 重读那条回答,确认每个品牌的归类和一位认真的人会给出的归类一致。
- 打开每一条来源链接,确认它能打开,并且支持它旁边的那句话。
- 确认运行条件是当时记录下来的,而不是事后补的。
- 留意修饰语:『适合』『不过』『更便宜但』——这些从句正是推荐变弱的地方。
你什么都没改,数字照样会动
这是「虚假的好消息」最常见的来源。重复采样研究表明,引用分布极度倾斜,被引域名的排序在不同样本之间并不稳定——不只是头部,而是贯穿整个高频被引集合。2很多两个域名之间看起来明显的差别,就落在测量自身的噪声底线里。
一篇关于重复查询审计的方法论文,量化了省掉重复的代价:5 次重复的信度约 0.58,10 次约 0.74,15 次约 0.81。3这意味着:五次是快速看一眼,十五次才算说得过去的一条记录;而几个百分点的波动,通常根本不是发现。
还有第二个会动的部件,靠重复次数是修不好的:模型自己会变。能固定就固定模型和模式;一旦模型换了,就把它当成一条新基线,而不是旧趋势的延续。
值得当真的危险信号
下面任何一条,都值得直接追问。三条同时出现,通常说明这个产品说不出它宣称能说的事。
- 只有一个总分,看不出背后的回答。
- 把提及写成推荐,或者把旁边的一条引用写成证据。
- 运行条件不披露,或者只有「最后更新」四个字却没有日期。
- 没有历史,每份报告都是一张无法比较的快照。
- 不能导出——这让独立核对在设计上就不可能。
- 把排名当成固定名次呈现,完全不提采样波动。
- 话术暗示「照这条路走就能被推荐」。
AI荐谁记录了哪些字段,哪些没有
同一套标准也得用在我们自己身上,所以这里逐项列出。没有提供的,就明写没有提供,而不是留给人去猜。
| 字段 | 状态 | 说明 |
|---|---|---|
| 问题集 | 已记录 | 生成后交由你审核,或手动录入;启用中的问题才会参与一次运行 |
| 模型与模式 | 已记录 | 固定使用同一个可联网搜索的模型,每次运行标注,并限制搜索调用次数 |
| 语言 | 已记录 | 审计跟随账户语言,问题集也用该语言撰写 |
| 完整回答原文 | 已记录 | 随每次审计运行一起保存,也是分类判断的依据 |
| 提及与推荐分开 | 已区分 | 作为两种不同观察分别归类,并同时保留模型带回的来源链接 |
| 每条回答的来源链接 | 已记录 | 按模型返回的原样保存;竞品自有的页面会被标注,而不会算作机会 |
| 竞品对比 | 已记录 | 细化到单条问题;自动发现的候选必须经你确认后才计入 |
| 历史记录 | 视方案而定 | 免费版不保留,Plus 保留 90 天,Pro 保留 730 天。更早的运行会被锁定,而不是删除。 |
| 原始数据导出 | 仅 Pro 提供 | 易读的网页报告:包含摘要、逐题结果、引用来源、可观察证据路径与行动建议,不包含完整回答原文。 |
| 不确定性区间 | 暂不提供 | 我们只报告某一次运行观察到什么,不发布跨重复运行的置信区间 |
| 固定搜索路径之外的平台 | 未提供 | 我们不测量自己并不运营的助手 |
之后仍用同一把尺子
真的做了改动之后,用完全相同的问题集、在完全相同的条件下再跑一次,然后把两条记录并排放。如果条件变了,就说条件变了,并且把差异当作「无法判定」,而不是当作胜利。
最后你会得到的不是一句承诺,而是一份说得清楚的交代:观察到了什么、依据是什么、还有哪些仍然不知道。这正是团队决定下一步该改什么时,真正需要的东西。