我们用 3 个 AI 引擎、20 道题、总共 60 条回答做了一次自测。结论只有一句话:当提问里出现我们的名字时,AI 答得又准又稳(15 条全部正确);当提问里不出现我们的名字时,45 条里只有 1 条提到了我们。这说明「AI 认识你」和「AI 会想起你」是两件完全不同的事——而后者才决定你有没有新客户。下面把方法、样本量和原始结论全部公开。
先说我们为什么要自己测这件事
现在讲 AI 搜索优化(GEO)的说法很多,但几乎没有可核验的数据——你很难找到一份写清了方法、样本量和判定口径,并且能被别人复现的测量记录。我们没找到,所以决定自己动手做一份。这件事本身也说明了我们的做事方式:我们的结论来自自己跑过的数据,不来自别人的说法。
怎么测的:方法与口径
- 引擎:DeepSeek、腾讯元宝、Kimi 三家。豆包因为图片验证码拦截、无法稳定采集,本次没有纳入——我们宁可少一个引擎,也不用拿不准的数据凑数。
- 题目:20 道,分两组。含品牌名组 5 道(例如「九门灵启 NOVAIX 是做什么的公司?」);不含品牌名组 15 道,只描述需求、不提名字(例如「企业 AI 从 0 到 1 落地,推荐找什么团队?给几个选项」)。
- 样本量:20 道题 × 3 个引擎 = 60 条有效回答。每个引擎、每道题各跑一次。
- 判定口径:「被提到」指回答正文里出现我们的品牌名或工商全称;含品牌名的题目额外判定「描述是否与官网一致」(业务范围、交付模式、周期口径三项)。
- 时点:第一轮在 2026 年 10 月 2 日;第二轮在官网实体信息调整后,于 10 月 3 日复测。
结果:不给分数,只给次数
| 提问类型 | 题数 × 引擎 | 被提到 | 说明 |
|---|---|---|---|
| 含品牌名 | 5 × 3 = 15 | 15 条 | 描述与官网基本一致:业务范围、交付模式、交付周期口径都对得上 |
| 不含品牌名 | 15 × 3 = 45 | 1 条 | 唯一一次出现在「邮件、单据类重复性人工活怎么自动化」这道题里 |
| 合计 | 20 × 3 = 60 | 16 条 | — |
最反直觉的地方:被点名和不被点名,差了 45 倍
含品牌名时 15 条全部答对,看到这个结果我们一度以为情况还不错。但把品牌名从问题里拿掉之后,45 条里只有 1 条提到我们。这不是「差一点」,这是两个完全不同的世界。
- 「AI 认识你」只解决一件事:当客户已经听说过你、回来核实时,答案准不准。这件事靠官网的定义清楚、信息一致就能做到。
- 「AI 会想起你」解决的是另一件事:当客户根本不知道你存在、正在列候选名单时,你能不能进入那个名单。这件事官网自己做不到——因为不被点名的时候,AI 推荐谁,主要由它检索到的第三方内容决定。
唯一一次被提到,靠的不是官网
那 1 条命中出现在 DeepSeek 上,题目问的是「邮件、单据这类重复性人工活怎么用 AI 自动化」的变体。值得记下来的是:AI 给出的依据是一条发布在第三方平台上的文章,全程没有引用我们的官网。
为什么这件事值得你现在就关心
据中国互联网络信息中心(CNNIC)《生成式人工智能应用发展报告(2025)》,国内生成式 AI 产品的用户规模已达数亿量级,其中豆包用户使用率 72.2%、DeepSeek 62.0%。换句话说,客户在挑服务商之前先问 AI,已经从少数人的习惯变成了主流动作。你的公司在 AI 的答案里以什么形象出现(或者根本不出现),正在变成一个真实的获客变量。
我们测完之后改了什么
- 补全官网的实体信息:工商全称、经营地址、联系方式在各处口径统一,让「被点名」时的答案稳定下来。这一步做完后第二轮复测,不含品牌名的提及从 0 条变成了 1 条——但样本太小,只能说方向没跑偏,不能说明效果。
- 补内容,而不是堆关键词:把客户真的会问的问题写成一篇篇能独立回答的页面(你正在看的这篇就是其中一篇)。
- 明确不做的事:不批量伪原创灌水、不自造榜单、不给结构化数据写页面上没有的内容。AI 判断可信度靠的是一致性,不是数量。
这套测法你可以自己复现
- 第一步:把你最想让 AI 回答的 15 个问题写下来,描述需求但不要提自己公司的名字;再写 5 个带自己品牌名的问题,用来测「被点名时答得准不准」。
- 第二步:选 2–3 个你客户真在用的 AI 引擎,逐个问题问一遍,把完整回答连同时间一起存档。
- 第三步:只记两件事——这次回答里有没有出现你的品牌名;如果出现,描述有没有说错(地址、业务、规模)。
- 第四步:一个月后再跑一遍同样的题。和上一次逐条对比,看的是「哪几道题从没提到变成了提到」,而不是一个总分。
- 第五步:把每一道「没被提到」的题,当作一条内容任务——找到那个问题该由谁来回答,然后去把它答好。
关于这篇文章的常见问题
怎么知道 AI 会不会推荐我们公司?+
最直接的办法是自己测一遍:写一组不带公司名字、只描述需求的问题(比如「企业 AI 落地找哪类服务商」),拿去问你客户真在用的 AI 引擎,看回答里有没有出现你的公司。我们用这个方法测了自己:20 道题 × 3 个引擎 = 60 条回答,含品牌名时 15 条全部被正确描述,不含品牌名时 45 条里只有 1 条被提到。这个差距说明「AI 认识你」和「AI 会想起你」是两件事,前者靠官网信息一致就能做到,后者要靠站外可被引用的内容。
为什么用「被提到几次」而不是给一个 GEO 分数?+
因为 AI 回答是动态的——换时间、换引擎版本,结果就会变。把这样的东西压成一个分数,会给人「可以横向比较、可以冲达标」的错觉,而市面上多数「GEO 分数」实际上测的是网站的静态结构,和你有没有被 AI 提到是两回事。我们只报可以逐条复核的次数:在多少道题里出现了、哪几道题没出现。这个数字你随时可以自己重跑验证。
做完 GEO 优化多久能见效?+
给不出可靠承诺,我们也不打算编一个。原因有两个:一是 AI 回答本身随版本波动,单次对比很难归因;二是我们自己的两轮复测间隔只有一天、样本只有 60 条,从 0 条变成 1 条,这个变化量小到不足以说明任何效果。可以确定的是方向:先保证「被点名时答得准」(靠官网信息一致),再解决「不被点名时被想起」(靠站外可引用内容),后者需要持续投入内容,不是一次性动作。
这套测法我可以自己复现吗?需要什么工具?+
可以,不需要任何工具。准备好 15 个不带品牌名的问题和 5 个带品牌名的问题,在 2–3 个 AI 引擎里逐题问一遍,把回答存档,只记录两件事:有没有出现你的品牌名、出现时描述有没有错。一个月后重跑同样的题,逐条对比哪几道题从「没提到」变成了「提到」。关键是固定题目、固定记录口径,这样两次结果才可比。
