GEO-SCORE · 开源量表

你的网站,
AI 能引用吗

21 项分档检查,合计 100 分。一行命令,约 20 秒。量表 MIT 开源、机器可读—— 任何人都能用同一套口径复算你的分数,包括你的竞品。这类工作海外多叫 AEO(Answer Engine Optimization),国内多叫 GEO。

现在就测你自己的站,不用装任何东西:

curl -sL https://raw.githubusercontent.com/jianruntech/geo-score/main/cli/geo_score.py \
  | python3 - 你的域名.com --brief

会跑命令的自己跑。不会的,或者跑完不知道该改什么的,让我们跑一遍并把结果讲给你——不收费。

只依赖标准库,Python 3.8 以上即可。也有 GitHub Action 版本,可在每次发布时卡住回退。

AIV 五维权重 RUBRIC v1.1
AIV 五维权重 横向条形图,横轴为权重分值,0 到 40。可被抓取 15 分,可被理解 22 分,内容可被引用 35 分,品牌可信 18 分,问答适配 10 分,合计 100 分。 可被抓取 15 可被理解 22 内容可被引用 35 品牌可信 18 问答适配 10 0510152025303540权重(分)
五个支柱合计 100 分。内容可被引用占 35 分,是权重最大的一块—— 因为回答引擎检索的是段落,不是站点:它要找一段能独立成立、可以直接引用的话。

三项门槛:不成立,后面全部白写

21 项里有三项是门槛。任何一项得零分,归一化结果直接封顶 40 分—— 不是扣分,是封顶。因为这三件事不成立的时候,后面十八项写得多好都到不了引擎手里。

爬虫是否被允许 robots.txt

在 robots.txt 里点名屏蔽了 AI 检索爬虫,内容就不会进入引擎的索引。 这有时是编辑决策——出版社和医疗站选择不被引用,很合理,量表照实记录,不说人家配置错了。

爬虫能否拿到 实际可达性

用十个真实检索 UA 逐个探测。有的站对浏览器返回 200、对爬虫返回 403—— 这一类最没人发现,因为在公司内部看,网站是好的。

正文是否在 HTML 里 服务端渲染

正文只在 JavaScript 跑完之后才存在的站,爬虫拿到的是一个空壳。 内容是有的、浏览器看得见,但引擎读不到。这一组几乎肯定不是有意的。

314 个知名网站实测,四分之一根本无法被引用

榜单是固定的公开名单,370 站列出、314 站测到,20 个行业每个至少 10 站—— 少于这个数的「行业中位数」说明不了任何事。原始数据在仓库里,你可以自己重跑核对。

314 站中无法被引用的 80 个站,按原因分为三组
原因站数性质
在 robots.txt 里点名屏蔽19编辑决策。他们选择不被引用
正文只在 JS 跑完后存在45几乎肯定不是有意的
直接给爬虫报错16浏览器 200、爬虫 403,内部看不出来

中位数 56 分,区间 12 到 98。 这三组加起来 80 个站,占实测的 25%——而这个比例在五次独立取样里都在 24–25%, 样本从 38 站一路到 314 站。

对做出海的还有一条更直接的:面向中文市场的站中位数 40,其余站 59,差 19 分。 这个差距在五次取样里落在 16 到 23 分之间。差的不是内容质量,是能不能被读到。

五个档位:说的是所处阶段,不是判决

外部基准显示,多数商业网站落在 30–55 分之间。 所以拿到四十几分是常态,不是警报——它说明的是「还没针对 AI 检索做过建设」,而不是「网站做得差」。

AIV 五个档位的分数区间与含义
档分数含义
领先83–100已建立优势,重点转向维持与扩大
基础扎实66–82地基完备,缺口集中在内容深度与品牌资产
成长期51–65主要项目已在做,差的是系统性与一致性
起步期31–50基础项有明显缺口,其中多数可在数人天内补齐
未起步0–30尚未针对 AI 检索做过建设,提升空间最大

为什么可以信这个分

一个测量工具最该被质疑的是它自己准不准。所以这三件事都写在仓库里,公开可查。

  1. 阈值不是拍的。 校准记录 写清每一档的分界怎么定,对齐了四个公开基准,也包括一次公开承认—— 发布前我们对分数分布的预测区间是错的,实测把它推翻了,记录里保留了两个数。
  2. 复现精度是实测的,不是声称的。 整个榜单跑两遍、逐站比对:96% 的站落在 ±5 以内,45% 完全一致。 所以单个站的分数请按 ±5 读,中位数是稳的。不稳的是门槛检查——两次之间有五个站翻转, 因为它们的 bot 防护对爬虫的答复变了。 全部数据
  3. 我们自己抓到的 bug 也写在里面。 比如 307/308 重定向在 Python 3.11 以下不被跟随,导致同一个站的分数取决于谁的 Python 在跑; 又比如请求头里英文优先,会让部分中文站交回它的国际版。 第二个改请求头解决不了,所以做法是记录而不隐藏:结果里会注明实际测的是哪个域名。
  4. 我们自己的榜单页也被同一套量表测。 当前 87 分,档位「领先」。分数和缺口都公开——包括还差的那几项。

测出问题之后,该怎么办?

量表只回答一件事:引擎能不能引用你。它会不会引用, 取决于竞争和提问意图,任何站外审计都观察不到——所以我们不承诺排名,也不承诺引用量。 仓库里也刻意不给修改建议:打分开源,改法是我们的活。

  1. 免费 AIV 速览。我们跑一遍,然后做量表做不了的那部分:哪些缺口是真的、哪些不用管,先修哪一环、值不值得修。分数本身你可以自己跑一遍复核——开源的意义就在这。
  2. GEO 诊断 · ¥5,888 起。AIV 基线报告 + 海外竞品差距 + 30 天行动清单。 报告本身就是能力证明——你拿着它自己改也行。
  3. 全链路陪跑 + AIV 看板。按月对比,用同一个分数说话。 边界写在明处:不做代运营、不按 ROI 抽成、不承诺替代人力。

常见问题

这和 SEO 是一回事吗

不是同一个问题。传统 SEO 问的是我排第几;回答引擎不排名—— 它检索段落、拼装答案、标注来源。

所以能被引用的前提变了:正文要在 HTML 里、开头一段要能独立成立、 数字要带出处、作者要可核。这些事 SEO 工具基本不测,因为在排名逻辑里它们不重要。

结论SEO 做得好的站,AIV 不一定高;反过来也成立。榜单上两种情况都不少。

分数低说明我的网站差吗

大多数情况下不说明。榜单中位数只有 56 分,四十几分是常态。 分数低通常意味着「没有针对 AI 检索做过建设」,而不是「网站做得差」—— 这两件事的修法完全不同。

被门槛封顶到 40 分的站尤其要看清原因:如果是正文只在 JS 跑完后存在, 那你的内容其实是好的,只是引擎读不到;如果是 robots.txt 点名屏蔽,那可能本来就是你们的决定。

为什么仓库里不给修改建议

刻意的。开源的是测量口径——量表、检查项、判据、原始数据, 目的是让分数可核验、可复算、可被质疑。

而怎么改、先改哪一项、投多少人天、谁来落地,是我们的交付内容。 把这两件事分开,量表才能被别人当中立标准用,包括被我们的竞品用。

我能自己复算榜单上的分数吗

能,这是设计目标。量表机器可读,每一档都写明「8 个采样页里命中几个」, 所以两个人测同一个站,算术上会一致。原始数据、跑分脚本、生成页面的脚本都在仓库里。

注意单次重跑有 ±5 的自然波动(采样页会变、站点的 bot 防护会变)。 要对比两个站,差距小于 5 分不要当结论。

榜单上没有我的站,能加吗

能。仓库里有专门的提交入口,要求先自己跑一遍并贴出结果那一行。 我们特别缺的是行业和语种覆盖薄的站——非英语站、受监管行业、平台、媒体。

提醒分数会公开,包括低分。这一点在提交模板里写明了, 而且不是自己的站也可以提名——所有检查都只跑公开网址。

量表都开源了,为什么还要找你们做免费速览?

因为量表只出数字,不出判断。你自己跑一遍拿到的分和我们跑的是同一个——这正是它开源的意义:我们给你的每一分你都能复核。速览多出来的是量表做不了的三件事。一,读结果:单次重跑有 ±5 的自然波动,门槛项会随站点的屏蔽策略翻转,哪些缺口是真的、哪些不用管,要有人看。二,放回你的生意里:九个环节先做哪一环,量表根本不知道你是做什么的。三,说清值不值得修、要多少工作量——打分我们开源了,改法是我们的活。会自己跑命令的,直接跑;不会的,或者跑完不知道下一步的,找我们,不收费。