首页 /SEO 干货

有些页面没必要索引 几条指令找出来

当我们在搜索引擎里输入一个词语,搜索引擎会从它的索引库(巨大的网站图书馆)里找出和这个词语相关的网页,然后按照一定的规则,把这些网页显示在搜索结果里。索引库就是搜索引擎收集和储存网页信息的地方,它是搜

Ray ChanRay Chan·2023-12-31·约 4 分钟·SEO 干货
目录
  1. 1.为什么有些页面不该被索引
  2. 2.找出问题页面的搜索指令
  3. 3.其他索引问题
  4. 4.让页面不被索引的方法
Ray Chan

铲子铺按语

索引膨胀会拖累整站排名:重复页、分页、作者页这些低价值页面占用了抓取预算。文里给了现成的搜索指令,site: 域名加 inurl:/tag/ 这类组合几分钟就能把问题页面列出来,再用 robots、noindex、canonical 处理。这属于新站上线就该做一遍的体检项目。

为什么有些页面不该被索引

搜索引擎通过爬虫不断访问网页,把内容和链接记录到索引库里,搜索时才能快速找到。但并不是所有的网页都适合被索引,索引膨胀 Index Bloat 问题甚至会对网站的排名和流量有负面影响。原因有几个:

  • 浪费抓取预算:谷歌会给网站分配一定量的抓取预算,如果垃圾页面太多,好页面展示的机会就会变少。
  • 有些网页的内容是重复的:比如归档页面、标签页面、分类页面等,和其他页面内容差别不大,只是展示方式不同。被索引会导致搜索引擎认为网站有重复内容问题,降低权威和信誉。
  • 有些网页的内容是敏感的:比如登录页面、注册页面、个人信息页面等,包含用户隐私或安全信息,被索引会导致信息泄露或被滥用。
  • 有些网页的内容是暂时的:比如活动页面、促销页面、测试页面等,只在一段时间内有效,被索引会导致搜索引擎显示过期或无效的信息。

找出问题页面的搜索指令

  • HTTP 页面site:yourdomain.com inurl:http://site:yourdomain.com -inurl:https://
  • 分页页面site:yourdomain.com inurl:/page/site:yourdomain.com inurl:p=
  • /tag/ 页面site:yourdomain.com inurl:/tag/
  • /author/ 作者页面site:yourdomain.com inurl:/author/
  • 带 WWW 和不带 WWW 的页面site:yourdomain.com inurl:www.site:yourdomain.com -inurl:www.
  • 电商网站的空类目页site:yourdomain.com "0 products found"

其他索引问题

  • URL 带斜杠和不带斜杠,属于规范化设置的问题,需要自己在后台做跳转。
  • URL 结尾带 Feed,属于 WordPress Feed 系统的默认参数,一般不需要特别处理,谷歌不会给这些页面索引,如果有强迫症,有些插件可以帮忙删掉。

让页面不被索引的方法

  • 直接删除:如果不是系统基本功能页面,可以直接删除,谷歌下次访问网站后视情况删除索引。
  • URL Removal Tool:在谷歌 Search Console 后台找到 URL Removal tool,直接提交要删除的 URL,谷歌会在特定时间内删除对应页面。
  • 使用 robots.txt 文件:告诉搜索引擎哪些页面可以访问、哪些不可以访问,可以指定哪些页面不允许被爬虫访问,从而避免被索引。
  • 使用 noindex 标签:告诉搜索引擎哪些页面不需要被索引,用 RankMath 等工具很方便设置。
  • 使用 canonical 标签:告诉搜索引擎哪些页面是重复的、哪些是首选的,把权重转移到首选页面上,避免重复内容问题。

总之,有些网页没必要被索引,因为它们会对网站的排名和流量有负面影响。用上面这些指令可以最快找到常见的索引膨胀页面,再用 robots.txt、noindex、canonical 等方法处理,从而提高网站的优化和推广效果。

内容来源

🌊
@独立站与SEO艺术

微信公众号 · 成海

UP 主页 →

专注谷歌 SEO 实战的外贸独立站公众号,覆盖关键词研究、内容策略、外链建设、EEAT 全链路。

Ray Chan

站长

Ray Chan

外贸独立站操盘手

做过外贸谈单、建过站、跑过 SEO、也拍 YouTube。常年服务国内工厂出海,坑踩过,路跑通,货都在这铺子里。