返回行业资讯
GEO别再迷信llms.txt:97%的文件根本没人读
📌 摘要
Ahrefs对十三万余个域名的服务器日志实测显示,97%的llms.txt文件在当月收到零请求,且没有任何AI爬虫会主动寻找这个文件。本文梳理Google官方优化指南与多项实测数据对llms.txt、结构化数据的最新结论,并给出中小企业做GEO真正该优先投入的三件事:放行AI爬虫、内容答案先行加对比表、统一各平台的企业实体信息,另附一个不懂技术也能做的自查方法。
如果你最近被人推销过GEO服务,对方十句话里有八句会提到llms.txt——「在网站根目录放个文件,AI就能读懂你的生意」。我这次要说的可能不太受欢迎:这个文件,97%根本没人读。做GEO把力气花在它上面,等于给一间没人进的门口挂招牌。
先把数字摊开。
97%这个数字是怎么测出来的?
Ahrefs在2026年5月做了一次规模不小的实测:抽取旗下Web Analytics里当月有真实流量的137210个域名,逐个访问根目录看有没有返回HTTP 200的llms.txt,再用Bot Analytics把所有对/llms.txt路径的请求按响应码和user-agent拆开统计。
结果有四条。
一,28%的域名确实发布了llms.txt——注意Ahrefs自己提醒,它的客户偏技术、偏懂SEO,这个比例应当视为上限,全网真实占比更低。
二,这些文件里97%在当月收到零请求。不是AI爬虫少,是一次都没有,人和机器都没来过。
三,真正被抓取的那3%里,96%的请求来自机器人,其中约19.5%来自具名AI工具。抓得最多的是GPTBot,第二名是Claude-Code——一个写代码的Agent,不是搜索爬虫。还有12%的请求来自研究llms.txt的检测工具和GEO工具本身,也就是这个行业在自己研究自己。
四,这条最要命:没有任何一个AI爬虫,去请求过一个不存在的llms.txt。它们从不主动找这个文件。
一个没人主动找的文件,不构成被发现的通道。这句话基本就把事情说完了。
Google到底怎么表态的?
2026年5月底,Google在生成式AI优化指南里专门开了一节,标题直接写着「Mythbusting:你不需要做的事」,llms.txt被点名列进去。截至2026年7月10日的更新版本,措辞更硬:你不需要为了出现在Google搜索(含其生成式AI能力)里创建任何机器可读文件、AI文本文件或Markdown文件,Google搜索本身不使用它们;你要为别的系统维护也没问题,但它既不会帮你也不会害你,因为Google搜索会忽略。
同一份文档的收尾建议里,llms.txt被和「切分内容」「刷不真实的品牌提及」列在一起,统称AEO/GEO小把戏,建议企业优先做有效的SEO。
Google内部并不完全统一。同一时间段,Chrome团队在Lighthouse的实验性审计里加了一项llms.txt检查,文档解释说没有这个文件时,Agent可能要花更多时间爬站来理解结构。John Mueller被问到这个矛盾时的回答值得记住:llms.txt「不是为搜索做的」,它是给解析开发文档的AI编程工具「省点token的临时拐杖」。
拐杖和跑鞋是两回事。你是卖建材、做代运营、开律所的,不是卖API文档的。
那FAQ结构化数据总该有用吧?
这也要打个问号。
Ahrefs在2026年5月对1885个页面做过一轮测量:页面上带不带匹配的JSON-LD结构化标记,在ChatGPT和Google AI Mode里的被引用率没有出现有意义的提升,在AI Overviews里甚至略有下降。而Google已经在2026年5月下线了FAQ富媒体结果。
市面上流传的GEO教程里,有一种说法是「同一篇文章加了FAQ Schema后,在Kimi和豆包的被引用率提升约47%」。我没查到这个数字的原始实验方法和样本量。当两组数据打架、其中一组还查不到出处的时候,老板该做的不是选一个信,而是去看自己服务器的日志——这是Mueller给的自测法:看那些真给你带来流量的AI系统,请求llms.txt的频率有没有请求robots.txt那么高。有,这事对你就是真的;没有,就别再听人讲了。
结构化数据本身不该废,Organization、Product、Review这类基础标记保持准确是应该的。但它是标签,不是内容的替代品——页面里没把话说清楚,贴标签也没用。
真正影响被AI引用的三件事
省下折腾文件的时间,往这三处放。
别把爬虫拦在门外。 这是最低成本、最容易漏的一项。据GEO审计机构ICODA披露的行业数据,84.2%的网站压根没有AI爬虫策略,而GPTBot是被屏蔽最多的那一个。robots.txt里要明确放行GPTBot、OAI-SearchBot、PerplexityBot、ClaudeBot、Google-Extended这些主流爬虫。另外,JavaScript渲染重的站要做服务端渲染,否则爬虫抓到的是一个空壳。同一份材料引用的2026年一项研究显示,屏蔽AI爬虫的出版商每周流量损失约7%。
答案写在最前面。 普林斯顿大学的GEO研究测出,把内容改成答案先行的结构,可见度最高能提升约40%,中等权重站点的提升幅度更大。落到操作上:每个小节开头先用四五十到七八十个词把结论直接说完,再展开论证;小标题写成用户真会打出来的问句。还有一条很实用——同一份材料指出,对比表格获得的引用量大约是叙述性文字的2.5倍。你有三款产品、三种方案要讲,就别写成散文,写成表。
让AI确认你是同一家公司。 AI引用之前会先确认这个品牌是不是一个真实、可交叉验证的实体。ICODA给出的来源分布是:ChatGPT的引用来源里维基百科占47.9%、Reddit占11.3%;Perplexity里Reddit高达46.7%。国内对应的场地是知乎、小红书、行业媒体和企业信息平台。关键不是刷量,是名称、地址、业务描述、联系方式在各处保持一致——三个平台三个说法,AI会判定信息冲突,直接不用你。
中小企业的优先级怎么排
一句话:先把爬虫放进来,再把内容改成答案先行加对比表,再去各个平台把公司信息统一。llms.txt愿意放就放,成本几乎为零,但别指望它,更别为它单独付钱。
想弄清自己现在到底有没有被AI提到,可以看企脉AI「GEO」栏目里的监测方法;准备找服务商之前,「避坑指南」栏目那几篇建议先过一遍。
💡 企脉观点
GEO这一年最大的问题不是没人做,是被做成了玄学。一个文件、一段代码、一个「AI友好」标签,就敢报价几万——本质是卖信息差。企脉的态度很明确。第一,凡是拿单个技术文件当核心卖点的GEO方案,直接砍掉,那不是杠杆,是安慰剂;第二,把钱花在能自己验证的地方,日志能看见爬虫来没来、内容能看出有没有把结论写在前面,这两件事你不懂技术也查得清;第三,实体一致性是中小企业最被低估的一块,官网、知乎、行业平台上的公司名和业务描述先统一,这活不花钱,效果比任何标记都实在。别再买玄学了,先把门打开。
❓ 常见问题(FAQ)
llms.txt要不要做?
想做就做,成本几乎为零,但别指望它带来曝光,更别为它单独付费。Ahrefs 2026年5月的实测里97%的文件零请求,且没有任何AI爬虫会去请求一个不存在的llms.txt——它们从不主动找。抓得最多的GPTBot和Claude-Code,主要是解析开发文档的场景。
怎么判断服务商讲的GEO方案靠不靠谱?
看他把预算压在哪。整套方案的重头戏是发文件、堆Schema、承诺几周上榜的,基本可以下判断了。靠谱的做法会先查robots.txt有没有拦AI爬虫、页面能不能在无JavaScript时正常呈现,再谈内容结构。
有没有我自己就能做的验证动作?
有。Google的John Mueller给过一个自测法:去看服务器日志,那些真给你带来流量的AI系统,请求llms.txt的频率有没有请求robots.txt那么高。有,这事对你就成立;没有,就别再听人讲了。日志找不到就问建站服务商要。
📚 资料来源
- 据Ahrefs 2026年5月的实测研究,对旗下Web Analytics中当月有流量的137210个域名统计发现,28%的域名发布了llms.txt,其中97%在当月收到零请求;被抓取的文件中96%请求来自机器人、约19.5%来自具名AI工具,抓取最多的是GPTBot、第二是Claude-Code,另有12%来自研究llms.txt的检测工具;没有任何AI爬虫请求过不存在的llms.txt。
- 据Google生成式AI优化指南(截至2026年7月10日更新版)在「Mythbusting」章节明确说明,站点无需创建llms.txt等机器可读文件即可出现在Google搜索及其生成式AI能力中,Google搜索会忽略这类文件;John Mueller称llms.txt「不是为搜索做的」,是给解析开发文档的AI编程工具省token的临时拐杖。
- 据Ahrefs 2026年5月对1885个页面的测量,JSON-LD结构化标记在ChatGPT与Google AI Mode中未带来有意义的引用提升,在AI Overviews中略有下降;Google已于2026年5月下线FAQ富媒体结果。
- 据GEO审计机构ICODA披露的行业数据,84.2%的网站没有任何AI爬虫策略、GPTBot是被屏蔽最多的爬虫,屏蔽AI爬虫的出版商在2026年一项研究中每周流量损失约7%;普林斯顿大学GEO研究显示答案先行的内容结构可提升可见度最高约40%,对比表格获得的引用量约为叙述性文字的2.5倍;ChatGPT引用来源中维基百科占47.9%、Reddit占11.3%,Perplexity中Reddit占46.7%。