GEO-SCORE · 开源量表
你的网站,
AI 能引用吗
21 项分档检查,合计 100 分。一行命令,约 20 秒。量表 MIT 开源、机器可读—— 任何人都能用同一套口径复算你的分数,包括你的竞品。这类工作海外多叫 AEO(Answer Engine Optimization),国内多叫 GEO。
现在就测你自己的站,不用装任何东西:
curl -sL https://raw.githubusercontent.com/jianruntech/geo-score/main/cli/geo_score.py \
| python3 - 你的域名.com --brief
会跑命令的自己跑。不会的,或者跑完不知道该改什么的,让我们跑一遍并把结果讲给你——不收费。
只依赖标准库,Python 3.8 以上即可。也有 GitHub Action 版本,可在每次发布时卡住回退。
三项门槛:不成立,后面全部白写
21 项里有三项是门槛。任何一项得零分,归一化结果直接封顶 40 分—— 不是扣分,是封顶。因为这三件事不成立的时候,后面十八项写得多好都到不了引擎手里。
在 robots.txt 里点名屏蔽了 AI 检索爬虫,内容就不会进入引擎的索引。
这有时是编辑决策——出版社和医疗站选择不被引用,很合理,量表照实记录,不说人家配置错了。
用十个真实检索 UA 逐个探测。有的站对浏览器返回 200、对爬虫返回 403—— 这一类最没人发现,因为在公司内部看,网站是好的。
正文只在 JavaScript 跑完之后才存在的站,爬虫拿到的是一个空壳。 内容是有的、浏览器看得见,但引擎读不到。这一组几乎肯定不是有意的。
314 个知名网站实测,四分之一根本无法被引用
榜单是固定的公开名单,370 站列出、314 站测到,20 个行业每个至少 10 站—— 少于这个数的「行业中位数」说明不了任何事。原始数据在仓库里,你可以自己重跑核对。
| 原因 | 站数 | 性质 |
|---|---|---|
| 在 robots.txt 里点名屏蔽 | 19 | 编辑决策。他们选择不被引用 |
| 正文只在 JS 跑完后存在 | 45 | 几乎肯定不是有意的 |
| 直接给爬虫报错 | 16 | 浏览器 200、爬虫 403,内部看不出来 |
中位数 56 分,区间 12 到 98。 这三组加起来 80 个站,占实测的 25%——而这个比例在五次独立取样里都在 24–25%, 样本从 38 站一路到 314 站。
对做出海的还有一条更直接的:面向中文市场的站中位数 40,其余站 59,差 19 分。 这个差距在五次取样里落在 16 到 23 分之间。差的不是内容质量,是能不能被读到。
五个档位:说的是所处阶段,不是判决
外部基准显示,多数商业网站落在 30–55 分之间。 所以拿到四十几分是常态,不是警报——它说明的是「还没针对 AI 检索做过建设」,而不是「网站做得差」。
| 档 | 分数 | 含义 |
|---|---|---|
| 领先 | 83–100 | 已建立优势,重点转向维持与扩大 |
| 基础扎实 | 66–82 | 地基完备,缺口集中在内容深度与品牌资产 |
| 成长期 | 51–65 | 主要项目已在做,差的是系统性与一致性 |
| 起步期 | 31–50 | 基础项有明显缺口,其中多数可在数人天内补齐 |
| 未起步 | 0–30 | 尚未针对 AI 检索做过建设,提升空间最大 |
为什么可以信这个分
一个测量工具最该被质疑的是它自己准不准。所以这三件事都写在仓库里,公开可查。
- 阈值不是拍的。 校准记录 写清每一档的分界怎么定,对齐了四个公开基准,也包括一次公开承认—— 发布前我们对分数分布的预测区间是错的,实测把它推翻了,记录里保留了两个数。
- 复现精度是实测的,不是声称的。 整个榜单跑两遍、逐站比对:96% 的站落在 ±5 以内,45% 完全一致。 所以单个站的分数请按 ±5 读,中位数是稳的。不稳的是门槛检查——两次之间有五个站翻转, 因为它们的 bot 防护对爬虫的答复变了。 全部数据
- 我们自己抓到的 bug 也写在里面。 比如 307/308 重定向在 Python 3.11 以下不被跟随,导致同一个站的分数取决于谁的 Python 在跑; 又比如请求头里英文优先,会让部分中文站交回它的国际版。 第二个改请求头解决不了,所以做法是记录而不隐藏:结果里会注明实际测的是哪个域名。
- 我们自己的榜单页也被同一套量表测。 当前 87 分,档位「领先」。分数和缺口都公开——包括还差的那几项。
测出问题之后,该怎么办?
量表只回答一件事:引擎能不能引用你。它会不会引用, 取决于竞争和提问意图,任何站外审计都观察不到——所以我们不承诺排名,也不承诺引用量。 仓库里也刻意不给修改建议:打分开源,改法是我们的活。
- 免费 AIV 速览。我们跑一遍,然后做量表做不了的那部分:哪些缺口是真的、哪些不用管,先修哪一环、值不值得修。分数本身你可以自己跑一遍复核——开源的意义就在这。
- GEO 诊断 · ¥5,888 起。AIV 基线报告 + 海外竞品差距 + 30 天行动清单。 报告本身就是能力证明——你拿着它自己改也行。
- 全链路陪跑 + AIV 看板。按月对比,用同一个分数说话。 边界写在明处:不做代运营、不按 ROI 抽成、不承诺替代人力。
常见问题
这和 SEO 是一回事吗
不是同一个问题。传统 SEO 问的是我排第几;回答引擎不排名—— 它检索段落、拼装答案、标注来源。
所以能被引用的前提变了:正文要在 HTML 里、开头一段要能独立成立、 数字要带出处、作者要可核。这些事 SEO 工具基本不测,因为在排名逻辑里它们不重要。
结论SEO 做得好的站,AIV 不一定高;反过来也成立。榜单上两种情况都不少。
分数低说明我的网站差吗
大多数情况下不说明。榜单中位数只有 56 分,四十几分是常态。 分数低通常意味着「没有针对 AI 检索做过建设」,而不是「网站做得差」—— 这两件事的修法完全不同。
被门槛封顶到 40 分的站尤其要看清原因:如果是正文只在 JS 跑完后存在, 那你的内容其实是好的,只是引擎读不到;如果是 robots.txt 点名屏蔽,那可能本来就是你们的决定。
为什么仓库里不给修改建议
刻意的。开源的是测量口径——量表、检查项、判据、原始数据, 目的是让分数可核验、可复算、可被质疑。
而怎么改、先改哪一项、投多少人天、谁来落地,是我们的交付内容。 把这两件事分开,量表才能被别人当中立标准用,包括被我们的竞品用。
我能自己复算榜单上的分数吗
能,这是设计目标。量表机器可读,每一档都写明「8 个采样页里命中几个」, 所以两个人测同一个站,算术上会一致。原始数据、跑分脚本、生成页面的脚本都在仓库里。
注意单次重跑有 ±5 的自然波动(采样页会变、站点的 bot 防护会变)。 要对比两个站,差距小于 5 分不要当结论。
榜单上没有我的站,能加吗
能。仓库里有专门的提交入口,要求先自己跑一遍并贴出结果那一行。 我们特别缺的是行业和语种覆盖薄的站——非英语站、受监管行业、平台、媒体。
提醒分数会公开,包括低分。这一点在提交模板里写明了, 而且不是自己的站也可以提名——所有检查都只跑公开网址。
量表都开源了,为什么还要找你们做免费速览?
因为量表只出数字,不出判断。你自己跑一遍拿到的分和我们跑的是同一个——这正是它开源的意义:我们给你的每一分你都能复核。速览多出来的是量表做不了的三件事。一,读结果:单次重跑有 ±5 的自然波动,门槛项会随站点的屏蔽策略翻转,哪些缺口是真的、哪些不用管,要有人看。二,放回你的生意里:九个环节先做哪一环,量表根本不知道你是做什么的。三,说清值不值得修、要多少工作量——打分我们开源了,改法是我们的活。会自己跑命令的,直接跑;不会的,或者跑完不知道下一步的,找我们,不收费。