首页 /文章 /建站技术

Shopify独立站技术SEO 001: Robots.txt 设置及规则

2026 年 robots.txt 的配法变了:既要管 Googlebot,还要管 GPTBot、Meta-ExternalAgent、ClaudeBot、PerplexityBot 这群 AI 爬虫。训练爬虫屏蔽省带宽,检索引用爬虫放行换 AI 引用,附 Shopify 动态参数屏蔽规则和 WordPress Yoast 实操。

Ray ChanRay Chan·2026-08-12·约 9 分钟·建站技术
目录
  1. 1.2026 年的 robots.txt:从“搜索引擎说明书”变成“AI 爬虫闸门”
  2. 2.底层逻辑:robots.txt 管抓取,管不了收录
  3. 3.Shopify 站实操:动态参数屏蔽 + AI 爬虫规则
  4. 4.WordPress 站实操:Yoast 插件或直接传文件
  5. 5.避坑清单与铲子铺怎么看

2026 年的 robots.txt:从“搜索引擎说明书”变成“AI 爬虫闸门”

网上讲 robots.txt 的资料还是老三样:怎么找到文件、怎么打开、怎么编辑、怎么保存,看完还是不知道往里面写啥。但 2026 年的 robots.txt 已经不是那个只给 Googlebot 看的文件了——它现在是你的站对两类爬虫的闸门:一类是传统搜索引擎爬虫(Googlebot、Bingbot),另一类是 AI 爬虫。AI 爬虫还分两种:一种来抓数据训练模型(GPTBot、ClaudeBot、Meta-ExternalAgent、CCBot),一种来做实时检索、打算在 AI 回答里引用你的内容(OAI-SearchBot、PerplexityBot、Meta-WebIndexer)。

区别很大:训练爬虫抓走你的内容当燃料,不给你带来一个访客,还可能烧掉你几百 GB 带宽——海外有站长晒过日志,Meta-ExternalAgent 一个月爬了他 790 万次、吃掉 900GB 流量;而检索引用爬虫抓你的页面,是为了在别人的 AI 回答里给你挂一个来源链接,这是白送的曝光。所以 2026 年配 robots.txt 的第一原则:按爬虫身份区别对待,不是一刀切全放或全挡。

底层逻辑:robots.txt 管抓取,管不了收录

先把概念掰清楚:robots.txt 只决定“爬虫能不能进你的站抓”,不决定“页面能不能出现在搜索结果里”。被 robots.txt 挡掉的页面,如果被别处外链指着,照样可能被收录(只是没摘要);真要彻底下线一个页面,得用 noindex 或 X-Robots-Tag。Google 官方文档也反复强调这点:robots.txt 的主要用途是管理抓取流量、防止服务器过载,不是藏页面的工具。

对独立站来说,它真正干的事是“减法”:把爬虫的力气从垃圾 URL 上抠出来,集中到产品页、分类页这些能出询盘的页面。Shopify 站最典型的问题是索引膨胀——商城自动生成海量动态参数 URL(筛选、排序、搜索、分页),客户随便点一下就是一个新地址,这些页面没排名价值,却占着抓取预算和索引额度。SEO 大部分时候是减法,说的就是这个。

Shopify 站实操:动态参数屏蔽 + AI 爬虫规则

第一步,检查现状:浏览器打开 https://你的域名/robots.txt,看文件在不在、有没有规则。多数 Shopify 模板自带默认规则(屏蔽 Cart、Checkout 这类页面),但默认项意义不大——搜索引擎本来也不太收录这些页。

第二步,屏蔽动态参数(防索引膨胀):Shopify 后台 → 在线商店 → 主题 → 编辑代码,找到 robots 相关文件,用 robots.default_groups 循环、针对 user_agent == '*' 追加规则:

User-agent: *
Disallow: /collections/all*
Disallow: /*?q=*
Disallow: /collections/vendors*?*q=*
Disallow: /collections/types*?*q=*
Disallow: /collections/*?*constraint*
Disallow: /collections/*/*
Disallow: /collections/*?*filter*
Disallow: /collections/*?*pf_*
Disallow: /collections/*?*view*
Disallow: /collections/*?*grid_list*
Disallow: /collections/?page=*
Disallow: /blogs/*/tagged/*

第三步,加 AI 爬虫规则:训练型爬虫默认屏蔽,检索引用型默认放行——

# 训练爬虫:抓了不给你带来访客,屏蔽
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: CCBot
Disallow: /

# 检索引用爬虫:在 AI 回答里引用你的内容,放行
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-Web
Allow: /
User-agent: Meta-WebIndexer
Allow: /

第四步,持续巡检(每月 10 分钟):GSC → 索引 → 页面,筛“已抓取但未收录”的 URL,把重复出现的模式补成规则。不会写通配符?把相同模式的 URL 整理好发给 AI,告诉它“这是要用于 robots.txt 的屏蔽规则”,让它统一匹配;生成完再拿给另一个 AI 复核一句“会不会误伤正常页面”,基本就稳了。

WordPress 站实操:Yoast 插件或直接传文件

WordPress 站配 robots.txt 有两条路:最省事的是装 Yoast SEO(或其他主流 SEO 插件),在 设置 → 文件编辑 里直接改 robots.txt,改完点保存,插件帮你托管文件;不想装插件,就通过 FTP 或主机文件管理器,在网站根目录放一个 robots.txt(没有就新建,文件名全小写、必须在根目录)。

内容框架跟 Shopify 同理:先保留默认规则、屏蔽 /wp-admin/、/wp-includes/ 这类后台目录(注意别挡 wp-content 里的 CSS/JS,那会伤渲染);再把上面那段 AI 爬虫规则原样贴进去;最后在文件末尾加上 Sitemap: https://你的域名/sitemap.xml 给爬虫指路。改完用 Google Search Console 的 robots.txt 检查器(在 设置 里)验证语法和规则生效——改错一个字符,整个站可能从爬取列表里消失,这个检查别省。

避坑清单与铲子铺怎么看

避坑五条:① robots.txt 只挡抓取不挡收录,已收录页面要下线用 noindex 或 301;② 别一刀切屏蔽整个目录——/collections/、/blogs/ 本身是正常内容,只屏蔽带参数的模式,上线前用 GSC 的 URL 检查工具测几个真实 URL;③ 别屏蔽 JS/CSS/图片资源,那会伤渲染、影响收录,属于自杀式操作;④ AI 生成的规则必须人审,通配符一个 * 的差别就是误伤一个目录;⑤ robots.txt 是“请求”不是“命令”——守规矩的爬虫会遵守,但个别爬虫(比如 Meta 的 Meta-ExternalFetcher)官方明说可能绕过,真要防死得靠服务器端拦截,别把 robots.txt 当安全工具。

铲子铺怎么看:这套东西的价值不在“会写 robots.txt”,而在想明白 2026 年的流量规则变了——搜索引擎和 AI 都在抢你的内容,你得自己决定谁是客人、谁是强盗。训练爬虫挡掉省带宽,检索爬虫放行换曝光,这个闸门一个月最多花你两小时,换的是索引健康度和 AI 时代的免费引用。别等到服务器账单爆了才想起来看日志。

Ray Chan

站长 · 关于本文

Ray Chan · 外贸独立站操盘手

做过外贸谈单、建过站、跑过 SEO、也拍 YouTube。常年服务国内工厂出海,坑踩过,路跑通,货都在这铺子里。

内容加工自 @独立站与SEO艺术(微信公众号 · 成海)的分享查看原文 ↗。