
铲子铺按语
索引膨胀会拖累整站排名:重复页、分页、作者页这些低价值页面占用了抓取预算。文里给了现成的搜索指令,site: 域名加 inurl:/tag/ 这类组合几分钟就能把问题页面列出来,再用 robots、noindex、canonical 处理。这属于新站上线就该做一遍的体检项目。
为什么有些页面不该被索引
搜索引擎通过爬虫不断访问网页,把内容和链接记录到索引库里,搜索时才能快速找到。但并不是所有的网页都适合被索引,索引膨胀 Index Bloat 问题甚至会对网站的排名和流量有负面影响。原因有几个:
- 浪费抓取预算:谷歌会给网站分配一定量的抓取预算,如果垃圾页面太多,好页面展示的机会就会变少。
- 有些网页的内容是重复的:比如归档页面、标签页面、分类页面等,和其他页面内容差别不大,只是展示方式不同。被索引会导致搜索引擎认为网站有重复内容问题,降低权威和信誉。
- 有些网页的内容是敏感的:比如登录页面、注册页面、个人信息页面等,包含用户隐私或安全信息,被索引会导致信息泄露或被滥用。
- 有些网页的内容是暂时的:比如活动页面、促销页面、测试页面等,只在一段时间内有效,被索引会导致搜索引擎显示过期或无效的信息。
找出问题页面的搜索指令
- HTTP 页面:
site:yourdomain.com inurl:http://、site:yourdomain.com -inurl:https:// - 分页页面:
site:yourdomain.com inurl:/page/、site:yourdomain.com inurl:p= - /tag/ 页面:
site:yourdomain.com inurl:/tag/ - /author/ 作者页面:
site:yourdomain.com inurl:/author/ - 带 WWW 和不带 WWW 的页面:
site:yourdomain.com inurl:www.、site:yourdomain.com -inurl:www. - 电商网站的空类目页:
site:yourdomain.com "0 products found"
其他索引问题
- URL 带斜杠和不带斜杠,属于规范化设置的问题,需要自己在后台做跳转。
- URL 结尾带 Feed,属于 WordPress Feed 系统的默认参数,一般不需要特别处理,谷歌不会给这些页面索引,如果有强迫症,有些插件可以帮忙删掉。
让页面不被索引的方法
- 直接删除:如果不是系统基本功能页面,可以直接删除,谷歌下次访问网站后视情况删除索引。
- URL Removal Tool:在谷歌 Search Console 后台找到 URL Removal tool,直接提交要删除的 URL,谷歌会在特定时间内删除对应页面。
- 使用 robots.txt 文件:告诉搜索引擎哪些页面可以访问、哪些不可以访问,可以指定哪些页面不允许被爬虫访问,从而避免被索引。
- 使用 noindex 标签:告诉搜索引擎哪些页面不需要被索引,用 RankMath 等工具很方便设置。
- 使用 canonical 标签:告诉搜索引擎哪些页面是重复的、哪些是首选的,把权重转移到首选页面上,避免重复内容问题。
总之,有些网页没必要被索引,因为它们会对网站的排名和流量有负面影响。用上面这些指令可以最快找到常见的索引膨胀页面,再用 robots.txt、noindex、canonical 等方法处理,从而提高网站的优化和推广效果。