SEO 工具

Robots.txt生成器

为你的网站生成有效的robots.txt文件。

给这个工具评分

如何使用 Robots.txt生成器

  1. 选择是允许还是屏蔽爬虫抓取。
  2. 添加需要禁止的路径以及站点地图网址。
  3. 复制文件内容,并以robots.txt为名上传到网站根目录。

关于 Robots.txt生成器

Robots.txt生成器会生成一个有效的robots.txt文件:一行User-agent,根据你选择的访问模式(全部允许、屏蔽整个网站,或除列出的路径外全部允许)生成相应的Disallow规则,以及可选的Crawl-delay和Sitemap行。路径会被统一规范为以斜杠开头。你只需复制生成结果,上传到你域名的根目录,爬虫会在/robots.txt这个位置查找它。

这是让搜索引擎不去抓取后台页面、购物车、站内搜索结果等你不希望被抓取的网址的标准做法。文件内容根据你的选择在浏览器中生成。

有一点必须理解清楚:robots.txt是一种礼貌性的请求,而不是一把锁。它只是要求遵守规则的爬虫不要抓取列出的路径——但它并不能让页面变得私密或安全。恶意机器人可以完全无视它,而且如果其他网站链接到某个被禁止抓取的页面,它仍然可能出现在搜索结果中。要实现真正的隐私保护,应使用noindex标签或密码保护,而不是robots.txt。另外要注意,Google会忽略Crawl-delay指令。等你的重要页面都能被正常抓取后,可以用站点地图生成器列出它们,并用Meta标签生成器设置页面级标签。

常见问题

robots.txt能让页面变得私密吗?

不能。它只是要求遵守规则的爬虫不要抓取某个路径,并不能隐藏、加密或密码保护任何内容,而且也只有守规矩的机器人才会遵守它。要实现真正的隐私保护,应使用身份验证或noindex指令。

被禁止抓取的页面还会出现在Google中吗?

会。如果其他网站链接到你禁止抓取的网址,它仍可能被收录并展示出来,有时甚至没有描述文字。要让页面彻底不出现在搜索结果中,应使用noindex标签,而不是robots.txt。

Crawl-delay对Google有效吗?

无效。Google会忽略Crawl-delay指令,并自行管理抓取速度。但有些其他爬虫确实会遵守这个指令,这也是工具仍然提供这个选项的原因。

这个文件应该放在哪里?

放在你域名的根目录,使其可以通过/robots.txt访问——例如example.com/robots.txt。爬虫只会在这个位置查找;放在子文件夹中的robots.txt不会被使用。

屏蔽某个路径会把它从搜索结果中移除吗?

不一定。屏蔽抓取实际上可能导致Google无法看到该页面上的noindex标签。要移除某个页面,应先允许它被抓取并添加noindex指令,或使用搜索引擎提供的移除工具。