索引膨胀:藏在报告里的隐形拖累
后台打开 Google Search Console,很多外贸站会吓一跳:「已抓取-尚未索引」几百上千条,点进去一看,全是 /tag/、/author/、/page/2/ 这类页面。再翻英文 SEO 社区,用 crawl budget、index bloat 这些词搜,SERP 前十几乎都在讲同一件事:网站收录了一堆没价值的页面,就是索引膨胀。排在前面的 Prerender、Uprankd、SEOClarity 几篇口径一致——谷歌抓取的页面里,大量是重复页、分页、筛选页、临时页,它们既没流量,还占着爬虫的时间和站点的质量信号。
为什么低价值页面会连累整站
第一,抓取预算有限。谷歌官方文档说得很直白:爬虫一天能抓的量是固定的,垃圾页抓多了,好页面就排不上队,新内容收录也跟着变慢。第二,重复内容信号。归档页、标签页、分类页和正文高度相似,搜索引擎会认为整站有重复问题,权威和信誉一起打折。第三,站点质量信号。英文圈那句「known pages 和 indexed pages 差距越大,越像 crawl bloat」现在越来越被当真——谷歌的抓取基础设施文档里,把「大量 URL 停在已发现-尚未索引」直接列为重点排查对象。到了 2026 年,评估你网站的爬虫不只有 Googlebot,GPTBot、ClaudeBot 这些 AI 爬虫也在按同样的逻辑看站点结构,索引越干净,越容易被 AI 问答当成可信来源引用。
几条指令,把问题页面全列出来
最快的办法是 site: 指令组合,几分钟列完:site:你的域名 inurl:/tag/(标签页)、inurl:/author/(作者页)、inurl:/page/(分页)、inurl:p=(老式分页)、inurl:www.(带 www 的重复版本),电商站再补一句 site:你的域名 "0 products found"(空类目页)。2026 年更省事的是直接看 GSC 的页面索引报告,按「已抓取-尚未索引」「已发现-尚未索引」倒序排,一眼看到大头,再对着 URL 结构批量归类。处理四件套:没用的直接删,删就删干净,返回 404/410;想保留但不想被搜到的加 noindex;重复页加 canonical 指到主版本;临时活动页用 noindex 或等它自然过期。
处理时最容易踩的坑
第一个坑,以为 noindex 能省抓取预算——谷歌社区里官方人员的答复说得很清楚:爬虫得先抓到页面才知道你 noindex 了,省不了多少预算,真省预算靠删页和 404/410。第二个坑,把重要的爬行路径页 noindex 了——比如首页指向全部文章的列表页,noindex 它等于断了整站的发现路径,英文讨论区里专门有人强调:任何承担发现职责的页面都不能 noindex。第三个坑,该删的用 robots 屏蔽——被 robots 挡的 URL 会一直留在抓取队列里反复重试,而 404/410 一次就清掉了,谷歌官方也建议永久删除的页面用 404 而不是屏蔽。第四个坑,软 404——页面返回 200、内容却是空的,这是官方文档点名的抓取预算黑洞,别让促销结束后只剩空壳的页面继续活着。
铲子铺怎么看
索引不是越多越好,是越值钱越好。2026 年搜索的竞争已经白热化:零点击搜索占比过六成,AI 概览直接把答案贴在结果页,能进索引只是入场券,索引里全是垃圾页,等于把入场券浪费在没人看的座位上。我的建议:新站上线做一遍索引体检,老站每季度跑一次 site: 指令扫一遍,把 tag、分页、空类目这些系统默认生成的东西管起来。这套动作花不了半天,但整站收录速度、抓取效率、内容权重都会明显变好。别等谷歌帮你「发现」问题,自己先把它清干净。
