robots.txt 爬虫规则生成与拦截测试

配置搜索引擎爬虫访问协议,并使用内置沙箱测试 URL 拦截规则。

快捷通用模板:
当前生效的抓取规则列表
User-agent 指令类型 匹配路径 (URL Path)

robots.txt 规则测试沙箱

RFC 9309 最长前缀匹配模拟
生成的 robots.txt 规范内容
嵌入此工具到你的网站 / 博客 无需开发 · 复制即可使用
HTML 嵌入代码 (iframe):
<iframe src="https://lucentool.com/zh/robots-txt-generator" width="100%" height="650" style="border:1px solid #e5e0d8;border-radius:12px;max-width:850px;width:100%;" frameborder="0"></iframe>
<div style="font-size:12px;color:#78716c;margin-top:6px;font-family:sans-serif;">Powered by <a href="https://lucentool.com/zh/robots-txt-generator" target="_blank" style="color:#c85a32;text-decoration:none;">Lucentool - robots.txt 爬虫规则生成与拦截测试</a></div>

什么是 robots.txt 与 RFC 9309 规范?

robots.txt 是网站根目录下用于告知搜索引擎蜘蛛(如 Googlebot、Bingbot、Baiduspider)哪些目录可以抓取、哪些目录禁止访问的标准纯文本协议。2022 年 IETF 正式将该协议标准化为 RFC 9309,确立了“最长匹配路径优先”(Longest match wins)的确定性仲裁规则。

常见灾难性错误排查