这些工具能看到什么,看不到什么
推荐监测工具的做法很朴素:把一组确定的问题抛给语言模型,把回答存下来,再整理成报告。问题来自你自己,或者来自厂商的提示词库;回答来自一个可以联网搜索的模型。整个过程里,任何一步都不会碰到别人的聊天记录。
这一点必须说清楚,因为仪表盘天然会让人产生相反联想。一个可见度百分比不是窃听装置,它是对若干次重复测试的汇总,而这些测试的运行条件本该被写下来、和数字放在一起。
- 能测到的:在一组确定的问题里,某个品牌出现的频率,以及模型在这些回答中带回了哪些公开来源。
- 测不到的:私下对话、买家真实的购买意图,以及「为什么是这家而不是那家」的因果解释。
- 谁都测不到的:下一次回答里会不会出现你。
同一个品类里,其实藏着四种需求
不同团队买这类工具的原因并不一样,而每种原因需要的证据也不一样。先想清楚你要解决哪一件事,再比价格——对某件事来说便宜好用的产品,换件事往往就是错的那个。
| 你要解决的事 | 真正需要的 | 可以先不看的 |
|---|---|---|
| 先摸个底 | 一份「机器怎么读你的公开页面」的基线 | 历史记录、竞品对标、额度管理 |
| 逐问题长期跟踪 | 固定的问题集、重复运行、变动记录 | 多品牌汇总 |
| 竞品与引用诊断 | 逐条回答对应的竞品名单和模型带回的来源链接 | 长期历史 |
| 多品牌或多市场运营 | 项目隔离、额度控制、分市场的问题集 | 几乎都省不掉,所以它最贵 |
经得起复核的七个维度
功能清单很快会同质化,所以要比的是演示结束后你还能亲手检查的东西。
- 一、问题归谁。问题集能不能自己改,还是只能用厂商给的库?你自己买家的说法,比别人的关键词库重要得多。
- 二、完整回答有没有留存。存的是整段回答,还是只是一个分数?分数底下没有回答,就没法核对、没法引用、也没法拿去解释。
- 三、提及、推荐、引用是不是分开的。名单里出现品牌名不等于推荐;回答旁边挂着一条链接,也不等于那条链接造成了这次回答。1
- 四、模型带回的来源链接。工具从头到尾不给链接,你就分不清这是自己站内的事实缺口,还是第三方覆盖缺口。
- 五、竞品对比要落到单条问题。公司层面的声量份额会盖掉真正重要的区别:在对比型问题里通吃、却在发现型问题里消失的对手,和处处领先的对手,是两个不同的问题。
- 六、历史记录要带运行条件。只有当模型、语言、市场、搜索开关都保持不变时,一条曲线才是曲线。
- 七、能不能导出、能不能审计。要一份原始导出,然后自己挑三行人工读一遍。这一项测试能解决演示里大部分的模糊地带。
AI荐谁处在什么位置
免费版是一份基于公开页面证据的网站就绪度基线:可访问性、身份、产品说明、证明、可索引前置条件,以及机器可读信号。每个项目每周含 1 次网站分析。它有意不包含推荐审计和竞品跟踪——这两件事靠一次爬取是做不到可信的。
Plus 月付 $49.90 或年付 $499,每月含 300 积分、2 个项目,每项目可保存 50 个问题,每次最多检查 10 个。Pro 月付 $99.90 或年付 $999,每月含 900 积分、5 个项目,每项目可保存 100 个问题,每次最多检查 20 个。
付费审计采样 ChatGPT API 联网回答,区分直接推荐、中性提及、最终回答引用和检索候选,并在内部保留回答供分析。自动发现的竞品在你确认前只是候选;后续比较也需要核对问题、语言和搜索条件。
Pro 可下载可读的 HTML 报告和用于交给 AI 助手的 Markdown 报告,包含结构化证据与任务,不是完整原始回答导出。现有报告下载不扣积分。目前只检查 ChatGPT;不要把问题库容量当作每次运行额度。
这个品类里常被提到的产品
以下供应商说明保留 2026 年 9 月 16 日的核查日期,并非排名,我们与它们没有合作关系。另见本页的相关对比:AI荐谁、OtterlyAI 与 Profound,使用 2026 年 9 月 28 日核查的官方来源。
一周就能跑完的试用
真正上手测过之后,有两个现象很明显。第一,这类产品大多是为「已经有人搜你」的品牌设计的,而这恰好是更小的公司没法假设的前提。第二,所有厂商的能力清单都是营销页面,不是独立测试——包括我们的。
所以试用自己跑。七步,一周,不用先付费。
- 写 10 到 20 个真实买家问题。发现型、对比型、替代型、预算型都要有,另外至少加一个场景型问题。
- 间隔一天跑两次。记下竞品名单晃动的幅度——那是你的噪声底线,不是你的业绩。
- 把返回的每一条来源链接都打开,确认那一页确实支持它旁边那句话。
- 要完整的回答原文,而不是摘要。如果拿不到,这本身就是答案。
- 确认提及、推荐、引用是被当作三种不同观察分别报告的。
- 确认每次运行都记录了模型、语言、市场和搜索开关。
- 问清楚:如果你停止付费,你的历史数据会怎样。
没有厂商能跨过去的那条线
关于重复采样的研究,结论一直指向同一个方向:完全相同的问题会产生不同的回答、引用不同的来源,而两个品牌之间看似明显的差距,往往落在测量本身的噪声范围里。6一篇关于重复查询审计的方法论文给出的信度大致是:5 次重复约 0.58,10 次约 0.74,15 次约 0.81——所以一次运行永远不该被当成判决。7
所以诚实的承诺其实很窄。监测工具能给你的,是一份可重复的记录:一个确定模型当时答了什么、带回了哪些来源、在相同条件下又变成了什么样。它不能许诺被推荐、被排名、带来流量或带来成交。当某个厂商暗示它可以,那就是继续找下去的理由。