SEO

Robots.txt 怎么写:外贸站常见的六个错误

2026年8月11日 · 约 4 分钟读完

robots.txt 放在网站根目录,告诉爬虫哪些路径不要抓。它是个非常小的文件,但每年都有站因为它白白损失几个月收录。

先记住一条最重要的规则

robots.txt 控制的是「抓取」,不是「收录」。被禁止抓取的页面,谷歌看不到页面上的 noindex,反而可能凭已有外链把它留在索引里,摘要还写着「信息不足」。

推论:想让某个页面从谷歌消失,正确做法是让它可抓取并加 noindex,或者返回 404 或 410,或者 301 走。用 robots.txt 屏蔽是常见误用。

外贸站六个常见错误

一、上线时忘了删测试站的屏蔽

最常见也最致命。很多主机面板、迁移插件会在 staging 环境写一行 Disallow: /。域名换成正式站后文件仍在,站就这么对谷歌隐身了。检查方法:访问域名/robots.txt,看到 Disallow: / 且不是故意的,立刻改。

二、屏蔽 /wp-content/

想把「非标准路径」藏起来,结果 CSS 与 JS 也一起被屏蔽,谷歌渲染页面失败,收录质量下降,还在 Search Console 里报「资源被屏蔽」。

三、把 robots 当 noindex 用

想屏蔽标签页、搜索结果页,用 robots 禁抓而不是 noindex 标记。结果它们仍然出现在索引里。正确做法是 SEO 插件里把这些类型设为 noindex(可抓取),见 SEO 插件清单。

四、写 Allow 但顺序不对

规则更具体的优先,而不是靠书写顺序。写「Disallow: /wp-admin/ 加 Allow: /wp-admin/admin-ajax.php」这种组合时,一定要实际验证。

五、塞一堆 User-agent 分组

针对十种爬虫各写一段,多数情况下毫无意义,还容易被 AI 爬虫规则带偏。写清楚 * 一组,必要时单独加一组就够了。

六、把 sitemap 行写成绝对路径错的

Sitemap: 行要写完整 URL(含 https 与域名)。写相对路径或不写,虽然核心地图也能被发现,但这是零成本的明确信号。

能直接抄的两份

正式上线的站:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /*?s=
Disallow: /*?add-to-cart=

Sitemap: https://example.com/sitemap_index.xml

开发中的测试站(要真正屏蔽整站,用最保守的写法,并确保上线时删除):

User-agent: *
Disallow: /

更稳的做法是测试站在服务器层加 HTTP 基本认证,并在页面里加 noindex 元标记,三重保险,避免忘记。

关于 AI 爬虫

GPTBot、ClaudeBot、Google-Extended 这些抓取标识现在常被单独讨论。判断标准只有一个:你要不要你的内容出现在别人的答案里,以及愿不愿意为此换取引用与流量。B2B 内容站通常会被 AI 引用带来少量品牌搜索,屏蔽与否都是策略,不是技术正确。

验证方法

  1. 浏览器直接访问 域名/robots.txt,看返回的是不是你以为的那份(缓存与 CDN 有时会给你旧文件)
  2. Search Console 的 robots.txt 测试工具,输入具体路径看是否被屏蔽
  3. Search Console 的「抓取统计信息」,看是否有大量针对某个参数的请求(比如 ?add-to-cart=),那说明需要加规则

robots.txt 的作用是把明显的浪费挡掉,别指望它优化排名。改完之后必须实测一条具体 URL,光看文件不算验收。

抓取相关还有个概念叫抓取预算,见 URL 与 Slug 里的参数页处理。

留下第一个评论