为什么演示帮不上你
这个品类里所有工具在演示时做的事都一样:你输入一个关于自己品类的问题,助手给出回答,仪表盘亮起来,显示你的品牌名和一个百分比。只跑一轮的话,它们告诉你的东西几乎相同——这正是它们难以区分的原因。
差别在第二轮会发生什么,以及工具从第一轮里留下了什么。这不是销售电话能演示的东西,因为它需要时间才能产生。这也是为什么试用比功能清单更重要的原因。
- 演示能证明的:工具能连上模型,能画出一张图。
- 演示证明不了的:两次运行之间是否一致。
- 只有你自己的试用能看出的:在你所在的品类里,答案稳不稳定到足以支撑一个决定。
开试用之前,先写 20 到 30 个问题
最有用的准备工作,发生在你看到任何界面之前。把你想得到答案的问题写下来,用客户的说法写,放在你自己能控制的地方。20 到 30 个就够开工。关键是这份清单是你的,而不是一套被调校成「容易出好看图表」的厂商提示词库。
脏的问题也要写。「适合小团队的最佳工具」和「两个人做代理值不值得买」是两个不同的问题,答案也可能不同。只测规整的那一版,你就看不到工具怎么处理真人真实的打字方式。
- 发现类:这件事该用什么工具?
- 比较类:在某个具体场景下,这个方案和那个方案比怎么样?
- 验证类:这个东西靠不靠谱,有没有已知的某个毛病?
- 预算类:每个月某个价位以内有什么可选?
- 一个关于你自己品牌的问题,就用你最怕客户会那样打的措辞。
先跑一遍,把原始回答存下来
把问题全跑一遍,在看任何分数之前,先把完整回答导出或复制下来。百分比底下没有回答,事后就没法核对;而真正有用的细节都藏在回答里:提到了哪些竞品、顺序如何、旁边引用了哪些页面。这些页面来自服务商自己文档里描述的那一步搜索,也是整条回答里人类真正能打开核对的部分。3
同时留意一件事:工具会不会把三种观察分开。一个品牌可以在回答里被提到、被推荐,或者作为来源页面被引用。这不是同一件事,把它们揉成一个「可见度」数字的工具,给你的信息比表面上少。
- 提及:你的名字出现在回答里的某个位置。
- 推荐:回答把你列为值得考虑的选项。
- 引用:你的某个页面被作为回答的来源返回。
- 用一个数字同时代表这三件事,等于替你做了选择。
隔一天再跑一遍,然后对比两份名单
这一步几乎没人在试用期做,而它产出的信息最多。同一组问题、同样的条件、间隔一天。然后看哪些东西动了。
一定幅度的晃动是正常的,而且有实测数据。一篇关于品牌推荐重复查询审计的协议论文给出了具体数字:迭代 5 次时泛化系数约 0.58,10 次约 0.74,15 次约 0.81。1 跑五次只是快速看一眼,不是结论。
如果两轮跑出来的竞品集合完全不同,这不必然说明工具不行。它说明你不该再把单个数字当成事实,而应该去问厂商:这个波动,你们是怎么处理的?
手动打开三条引用,自己看
不管工具怎么描述它的来源,挑几条打开看。被引用的页面应该真的包含它旁边那句话在说的事。这件事花十分钟,能区分出两种工具:真的存了 URL 的,和把域名当装饰摆出来的。
- 链接打得开吗?它是你希望买家去读的那个页面吗?
- 这个页面真的支撑得起它旁边那句判断吗?
- 来源是你自己的站、竞争对手的站,还是独立第三方?
- 如果竞品被引用而你没有,你的站上是不是本该有一个回答得更好的页面?
那个会误导你的数字
单次运行的可见度百分比看起来很精确,其实不是。一项横跨三个生成式搜索平台采样引用行为的研究发现:引用分布呈幂律形态,排序的不稳定性不只出现在头部,而是贯穿整个高频被引集合;很多两个域名之间看起来明显的差别,落在测量自身的噪声底线之内。2
所以当仪表盘显示你 38%、竞品 41%,诚实的读法是:单次运行分不出这两个数。你真正能比较的,是你自己控制的两轮运行之间的变化。
试用结束时,你应该能说出这五句话
五条都能答上来,就够做决定了。答不上两条以上,说明这轮试用测的是演示,不是工具。
- 问题是我自己的,而且我不用求任何人就能再跑一遍同一组。
- 我手里有完整回答文本,不只是分数。
- 我知道这个工具是否把提及、推荐和引用当成三件不同的事。
- 我至少打开过三条被引用的页面,而且它们经得起看。
- 我知道同样两轮之间,竞品名单晃动了多少。
试用测不出来的东西
它测不出「补上这些缺口之后会不会被推荐」。没有工具能承诺这件事,承诺了的厂商卖的就不是测量。
它也解释不了竞争对手为什么被推荐。你能看到他们确实被推荐了,能看到回答旁边出现了哪些页面,但因果这一步从模型外面观察不到。
它能做的,是把一个猜测换成你自己跑出来的测量结果。这个说法比这个品类通常的口气小得多,但它是经得起第二次核对的那一个。