Meta(Facebook、Instagram、WhatsApp 的母公司)的 AI 爬虫正在大规模抓取全网网站,这事在英文圈炸锅后,做外贸独立站的老板最该关心的不是“内容被偷”,而是三个问题:它怎么发生的、该不该屏蔽、屏蔽了有什么后果。
先说结论:3 件事
第一,Meta 的 AI 爬虫正在大规模抓取网站。 有独立开发者统计,他的几个网站 16 小时里被 Meta 的 AI 爬虫访问了 9967 次,平均每 6 秒一次,直接把服务器负载打到报警。
第二,Meta 官方文档写得很清楚: 它有一个叫 Meta-ExternalFetcher 的爬虫,可以绕过 robots.txt。robots.txt 就是网站主人写的“哪些地方你别进”的牌子,Meta 说这个爬虫执行的是用户请求,所以可以无视你的牌子。
第三,这事跟做外贸的你直接相关: 你的独立站内容,正在变成 Meta AI 的训练材料和引用来源。这不一定坏事,但你要知道它发生了,然后决定怎么应对。
Meta 到底有哪些爬虫在抓你的站
Meta 官方文档(developers.facebook.com 的 Web Crawlers 页面,2026 年 5 月更新)列了 5 个爬虫:
| 爬虫名 | 干什么用 | 会不会绕过 robots.txt |
|---|---|---|
| Meta-WebIndexer | 为 Meta AI 搜索建索引,提升搜索质量 | 不会,遵守 |
| Meta-ExternalAgent | 训练 AI 基础模型、直接收录内容 | 不会,遵守 |
| Meta-ExternalAds | 广告相关业务 | 不会,遵守 |
| Meta-ExternalFetcher | 按用户请求抓取链接,帮 AI 代理替用户完成任务 | 可能绕过 |
| FacebookExternalHit | 抓你在 Facebook/WhatsApp 分享的链接预览 | 安全检查时可能绕过 |
重点看 Meta-ExternalFetcher:官方原话是“它按用户请求抓取单个链接,支持评估和提升 agentic AI 能力,包括帮 AI 浏览网站替用户完成任务,因此,这个爬虫可以绕过 robots.txt 规则。”
翻译成人话:当有人(或某个 AI 代理)问 Meta AI“帮我查一下某某供应商”的时候,Meta 的爬虫会去抓相关网站,这一步不受你网站 robots.txt 的限制。
对你的网站意味着什么
三个层面:
- 内容被“读”走。 你的产品描述、参数、联系方式、博客文章,都在被 Meta 的 AI 抓取、分析、建索引。这是 AI 时代的常态——Google、OpenAI、Anthropic 的爬虫都在干这事,Meta 只是又添了一家。
- 可能出现在 Meta AI 的引用里。 Meta 官方说,允许 Meta-WebIndexer 抓取,有助于你的内容在 Meta AI 回复时被引用和链接。WhatsApp 有 30 亿用户,如果未来 WhatsApp 里的 AI 助手推荐供应商时能引用你的站——这就是一条全新的询盘入口。
- 服务器资源被消耗。 9967 次访问能把服务器打报警。便宜虚拟主机上,爬虫风暴可能拖慢网站速度,影响真实客户访问。
三步自查:Meta 的爬虫在抓你的站吗
不用装任何工具,打开网站服务器日志(宝塔面板、cPanel 都有访问日志功能),搜这三个字符串:
meta-externalagent
meta-webindexer
meta-externalfetcher
第一步: 登录服务器控制面板,找到「访问日志」或「网站日志」。 第二步: 搜索上面三个关键词(或者 meta- 开头都行),看有没有访问记录、频率多少。 第三步: 看到成百上千次记录,说明你的站正在被 Meta AI 大量抓取。
看不懂日志没关系,看到有 meta- 开头的 User-Agent 就是 Meta 的爬虫。
该不该屏蔽?一张决策表
结论先行:不建议全屏蔽,按情况来。
| 你的情况 | 建议 |
|---|---|
| 想做海外市场、希望被 AI 推荐 | 不屏蔽,让 Meta-WebIndexer 抓(它帮你建索引、有机会被引用) |
| 网站内容有独家产品信息、怕被抄 | 只屏蔽 Meta-ExternalAgent(训练模型用) |
| 服务器经常被打爆、资源紧张 | 屏蔽 meta-externalagent 和 meta-externalfetcher,保留 meta-webindexer |
| 有敏感信息(如后台、客户数据) | 确认这些路径本来就在 robots.txt 里 Disallow 了 |
屏蔽写法(加到 robots.txt 顶部):
User-agent: meta-externalagent
Disallow: /
改完等 24 小时生效(Meta 官方说爬虫缓存 robots.txt 最长 24 小时)。
注意:就算屏蔽了 meta-externalfetcher,它“可能绕过”——它的设计目的就是帮用户抓取公开网页,跟 Google 爬虫遵守规则、OpenAI 爬虫大部分遵守规则不一样,Meta 这个“用户请求优先”。
对做外贸的你,真正的机会在哪
很多同行担心“内容被偷”,我的看法反过来了:
AI 正在变成海外客户的第一道“问路工具”。 以前客户找供应商:Google 搜 → 翻排名 → 进网站。现在越来越多人:问 ChatGPT / Meta AI / Claude → AI 直接给推荐。如果你的网站内容能被 AI 读懂、被 AI 引用,你就是那个“被推荐的人”。
比起纠结屏蔽,更值得做的是让网站内容对 AI 友好:
- 产品页面写清楚规格、材质、起订量、交期、认证(AI 最喜欢结构化信息)
- 用 FAQ 形式覆盖客户常问的问题(AI 引用问答内容概率高)
- 保持内容原创、真实(AI 不会推荐内容农场)
给老板的检查清单(今天就能做)
- 花 5 分钟打开服务器日志,搜
meta-开头的 User-Agent,确认有没有被大量抓取 - 按决策表对号入座,决定屏蔽哪个、留哪个
- 改完 robots.txt 等 24 小时,再查一次日志看爬虫还来不来
- 顺手把产品页的规格、FAQ 补一补——不管 Meta 来不来,AI 时代的网站内容就是“被读得懂才有机会被推荐”
背景事实来源:Pieter Levels 2026-08-06 X 爆料 + Meta 官方 Web Crawlers 文档(2026-05 更新),事件数据以原始来源为准。
