GEO 与 AI 可见度2026-10-04约 8 分钟

AI 会不会推荐你的公司?我们实测了 60 条提问,方法全公开

我们用 3 个 AI 引擎、20 道题、总共 60 条回答做了一次自测。结论只有一句话:当提问里出现我们的名字时,AI 答得又准又稳(15 条全部正确);当提问里不出现我们的名字时,45 条里只有 1 条提到了我们。这说明「AI 认识你」和「AI 会想起你」是两件完全不同的事——而后者才决定你有没有新客户。下面把方法、样本量和原始结论全部公开。

先说我们为什么要自己测这件事

现在讲 AI 搜索优化(GEO)的说法很多,但几乎没有可核验的数据——你很难找到一份写清了方法、样本量和判定口径,并且能被别人复现的测量记录。我们没找到,所以决定自己动手做一份。这件事本身也说明了我们的做事方式:我们的结论来自自己跑过的数据,不来自别人的说法。

怎么测的:方法与口径

  • 引擎:DeepSeek、腾讯元宝、Kimi 三家。豆包因为图片验证码拦截、无法稳定采集,本次没有纳入——我们宁可少一个引擎,也不用拿不准的数据凑数。
  • 题目:20 道,分两组。含品牌名组 5 道(例如「九门灵启 NOVAIX 是做什么的公司?」);不含品牌名组 15 道,只描述需求、不提名字(例如「企业 AI 从 0 到 1 落地,推荐找什么团队?给几个选项」)。
  • 样本量:20 道题 × 3 个引擎 = 60 条有效回答。每个引擎、每道题各跑一次。
  • 判定口径:「被提到」指回答正文里出现我们的品牌名或工商全称;含品牌名的题目额外判定「描述是否与官网一致」(业务范围、交付模式、周期口径三项)。
  • 时点:第一轮在 2026 年 10 月 2 日;第二轮在官网实体信息调整后,于 10 月 3 日复测。

结果:不给分数,只给次数

提问类型题数 × 引擎被提到说明
含品牌名5 × 3 = 1515 条描述与官网基本一致:业务范围、交付模式、交付周期口径都对得上
不含品牌名15 × 3 = 451 条唯一一次出现在「邮件、单据类重复性人工活怎么自动化」这道题里
合计20 × 3 = 6016 条—
我们刻意不给这件事算一个「分数」。原因很简单:AI 回答是动态的,换个时间、换个引擎版本,结果就会变;把它压成一个分数,会给人「可以比较、可以达标」的错觉。真正有意义的是「在多少道题里被提到」这个可以逐条复核的次数。

最反直觉的地方:被点名和不被点名,差了 45 倍

含品牌名时 15 条全部答对,看到这个结果我们一度以为情况还不错。但把品牌名从问题里拿掉之后,45 条里只有 1 条提到我们。这不是「差一点」,这是两个完全不同的世界。

  • 「AI 认识你」只解决一件事:当客户已经听说过你、回来核实时,答案准不准。这件事靠官网的定义清楚、信息一致就能做到。
  • 「AI 会想起你」解决的是另一件事:当客户根本不知道你存在、正在列候选名单时,你能不能进入那个名单。这件事官网自己做不到——因为不被点名的时候,AI 推荐谁,主要由它检索到的第三方内容决定。

唯一一次被提到,靠的不是官网

那 1 条命中出现在 DeepSeek 上,题目问的是「邮件、单据这类重复性人工活怎么用 AI 自动化」的变体。值得记下来的是:AI 给出的依据是一条发布在第三方平台上的文章,全程没有引用我们的官网。

这条观察印证了一个判断:官网做得好,只能保证「被点名时答得准」;要让 AI 在不被点名时想起你,必须存在它能检索到、并且愿意引用的站外内容。两件事要分开做,不能互相替代。

为什么这件事值得你现在就关心

据中国互联网络信息中心(CNNIC)《生成式人工智能应用发展报告(2025)》,国内生成式 AI 产品的用户规模已达数亿量级,其中豆包用户使用率 72.2%、DeepSeek 62.0%。换句话说,客户在挑服务商之前先问 AI,已经从少数人的习惯变成了主流动作。你的公司在 AI 的答案里以什么形象出现(或者根本不出现),正在变成一个真实的获客变量。

我们测完之后改了什么

  • 补全官网的实体信息:工商全称、经营地址、联系方式在各处口径统一,让「被点名」时的答案稳定下来。这一步做完后第二轮复测,不含品牌名的提及从 0 条变成了 1 条——但样本太小,只能说方向没跑偏,不能说明效果。
  • 补内容,而不是堆关键词:把客户真的会问的问题写成一篇篇能独立回答的页面(你正在看的这篇就是其中一篇)。
  • 明确不做的事:不批量伪原创灌水、不自造榜单、不给结构化数据写页面上没有的内容。AI 判断可信度靠的是一致性,不是数量。

这套测法你可以自己复现

  • 第一步:把你最想让 AI 回答的 15 个问题写下来,描述需求但不要提自己公司的名字;再写 5 个带自己品牌名的问题,用来测「被点名时答得准不准」。
  • 第二步:选 2–3 个你客户真在用的 AI 引擎,逐个问题问一遍,把完整回答连同时间一起存档。
  • 第三步:只记两件事——这次回答里有没有出现你的品牌名;如果出现,描述有没有说错(地址、业务、规模)。
  • 第四步:一个月后再跑一遍同样的题。和上一次逐条对比,看的是「哪几道题从没提到变成了提到」,而不是一个总分。
  • 第五步:把每一道「没被提到」的题,当作一条内容任务——找到那个问题该由谁来回答,然后去把它答好。
局限说明:本次测量样本量只有 60 条回答,只覆盖 3 个引擎,且 AI 回答本身会随版本和时间变化。我们把它作为一次可复核的起点记录,而不是一份结论性的研究。文中所有数字都来自这份 60 条记录的逐条判定,未做任何外推。

关于这篇文章的常见问题

怎么知道 AI 会不会推荐我们公司?+

最直接的办法是自己测一遍:写一组不带公司名字、只描述需求的问题(比如「企业 AI 落地找哪类服务商」),拿去问你客户真在用的 AI 引擎,看回答里有没有出现你的公司。我们用这个方法测了自己:20 道题 × 3 个引擎 = 60 条回答,含品牌名时 15 条全部被正确描述,不含品牌名时 45 条里只有 1 条被提到。这个差距说明「AI 认识你」和「AI 会想起你」是两件事,前者靠官网信息一致就能做到,后者要靠站外可被引用的内容。

为什么用「被提到几次」而不是给一个 GEO 分数?+

因为 AI 回答是动态的——换时间、换引擎版本,结果就会变。把这样的东西压成一个分数,会给人「可以横向比较、可以冲达标」的错觉,而市面上多数「GEO 分数」实际上测的是网站的静态结构,和你有没有被 AI 提到是两回事。我们只报可以逐条复核的次数:在多少道题里出现了、哪几道题没出现。这个数字你随时可以自己重跑验证。

做完 GEO 优化多久能见效?+

给不出可靠承诺,我们也不打算编一个。原因有两个:一是 AI 回答本身随版本波动,单次对比很难归因;二是我们自己的两轮复测间隔只有一天、样本只有 60 条,从 0 条变成 1 条,这个变化量小到不足以说明任何效果。可以确定的是方向:先保证「被点名时答得准」(靠官网信息一致),再解决「不被点名时被想起」(靠站外可引用内容),后者需要持续投入内容,不是一次性动作。

这套测法我可以自己复现吗?需要什么工具?+

可以,不需要任何工具。准备好 15 个不带品牌名的问题和 5 个带品牌名的问题,在 2–3 个 AI 引擎里逐题问一遍,把回答存档,只记录两件事:有没有出现你的品牌名、出现时描述有没有错。一个月后重跑同样的题,逐条对比哪几道题从「没提到」变成了「提到」。关键是固定题目、固定记录口径,这样两次结果才可比。