当我们在搜索引擎里输入一个词语,搜索引擎会从它的索引库(巨大的网站图书馆)里找出和这个词语相关的网页,然后按照一定的规则,把这些网页显示在搜索结果里。索引库就是搜索引擎收集和储存网页信息的地方,它是搜索引擎的核心。搜索引擎会通过一些程序,叫做爬虫,不断地访问网上的网页,把它们的内容和链接记录下来,然后加入到索引库里。这样,搜索引擎就可以快速地找到用户想要的网页。但是,并不是所有的网页都适合被索引,有些网页没必要被索引,索引膨胀Index Bloat问题甚至会对网站的排名和流量有负面的影响。为什么呢?**有以下几个原因:****• 浪费抓取预算,**谷歌会给网站分配一定量的搜索预算,如果垃圾页面太多, 那么好的页面展示机会就会变少。• 有些网页的内容是重复的 ,比如一些归档页面、标签页面、分类页面等,它们和其他页面的内容没有太大的区别,只是展示方式不同。如果这些页面被索引,会导致搜索引擎认为网站有重复内容的问题,从而降低网站的权威和信誉。• 有些网页的内容是敏感的 ,比如一些登录页面、注册页面、个人信息页面等,它们包含了用户的隐私或者安全信息,如果这些页面被索引,会导致用户的信息泄露或者被滥用,从而损害用户的利益和信任。• 有些网页的内容是暂时的 ,比如一些活动页面、促销页面、测试页面等,它们只在一段时间内有效,如果这些页面被索引,会导致搜索引擎显示过期或者无效的信息,从而降低用户的满意度和体验。几条找到这些页面的搜索指令: HTTP页面 要找到网站被索引的HTTP页面,请在Google上使用以下搜索指令:site:yourdomain.com inurl:http://site:yourdomain.com -inurl:https://分页页面要找到被索引的分页页面,使用以下搜索语法:site:yourdomain.com inurl:/page/site:yourdomain.come inurl_p= /tag/ 页面 使用如下搜索指令: site:yourdomain.com inurl:/tag/ /Author作者/页面 使用如下搜索指令
site:yourdomain.com inurl:/author/ 带WWW.和不带WWW.页面 使用如下指令: site:yourdomain.com inurl:www. site:yourdomain.com -inurl:www. 电商网站上的空类目页
使用如下指令: site:yourdomain.com “0 products found” 还有一些其他的索引页面问题:
URL带斜杠和不带斜杠, 这个属于规范化设置的问题, 需要自己在后台跳转.
URL结尾带Feed, 这个属于WordPress Feed系统的默认参数, 一般不需要特别处理, 谷歌那边也不会给这些页面索引, 如果有强迫症, 有些插件可以帮忙删掉.
那么,如何让这些网页不被索引呢 ?有以下几种方法:• 直接删除 ,如果不是系统基本功能页面, 可以直接删除, 谷歌下次访问网站后视情况删除索引.•****URL Removal Tool, 在谷歌Search Console后台找到URL Removal tool, 直接提交要删除的url, 谷歌在特定的时间内就会删除对应页面.• 使用 robots.txt 文件 ,这是一个告诉搜索引擎哪些页面可以访问,哪些页面不可以访问的文件,它放在网站的根目录下,搜索引擎会在访问网站之前,先读取这个文件,然后按照它的指示,决定是否访问某个页面。你可以在这个文件里,指定哪些页面不允许被爬虫访问,从而避免被索引。• 使用 noindex 标签 ,这是一个告诉搜索引擎哪些页面不需要被索引的标签,它放在网页的头部代码里,搜索引擎会在访问网页之后,先读取这个标签,然后按照它的指示,决定是否把这个页面加入到索引库里。你可以在这个标签里,指定哪些页面不需要被索引,从而避免被索引。用rankmath等工具很方便设置.• 使用 canonical 标签 ,这是一个告诉搜索引擎哪些页面是重复的,哪些页面是首选的的标签,它放在网页的头部代码里,搜索引擎会在访问网页之后,先读取这个标签,然后按照它的指示,决定是否把这个页面视为重复的,或者把它的权重转移到首选的页面上。你可以在这个标签里,指定哪些页面是重复的,哪些页面是首选的,从而避免重复内容的问题。总之 ,有些网页没必要被索引,因为它们会对网站的排名和流量有负面的影响。使用上面提到的那些指令可以用最快的方式找到那些常见的索引膨胀页面.你可以通过使用 robots.txt 文件、noindex 标签、canonical 标签等方法,来让这些网页不被索引,从而提高你的网站的优化和推广效果。 That’s a Wrap.