我的知识记录

限制百度蜘蛛抓取频率_robots检测工具与收录恢复

限制百度蜘蛛抓取频率的标准写法:User-agent: Baiduspider 针对百度蜘蛛,User-agent: * 针对所有蜘蛛。Disallow: /admin/ 禁止抓取后台目录,Disallow: /? 禁止抓取带问号的动态 URL,Allow: / 允许抓取全站。规则按顺序匹配,先匹配到的先生效。

限制百度蜘蛛抓取频率不在 robots.txt 里写(robots 没有频率参数),而是在百度站长平台 → 抓取频次 → 设置抓取压力。选"平和"会降低抓取频率,适合流量紧张的虚拟主机。调整后 1 到 3 天生效,蜘蛛请求量下降 30% 到 50%。

配置参考(robots.txt 标准示例): ``` User-agent: * Disallow: /admin/ Disallow: /install/ Disallow: /temp/ Disallow: /*?* Disallow: /*?page= Allow: /

User-agent: Baiduspider Disallow: /admin/ Disallow: /*?s=

Sitemap: https://域名/sitemap.xml ```

禁止了整站抓取是常见坑。Disallow: /admin 会匹配 /admin、/adminabc、/admin/xxx,要精确禁止目录用 Disallow: /admin/(带尾斜杠)。Allow 优先级在百度蜘蛛里是"最具体的规则优先",不是简单的先到先得,写复杂规则前用检测工具验证。

robots.txt 与 301、404 的配合:页面已删除不要只靠 robots 禁止,要让页面返回 404 再提交死链;页面移动到新地址用 301,不要 robots 禁止旧地址(禁止后蜘蛛不抓取,301 无法传递权重)。robots.txt 管抓取范围,301 和 404 管状态码,三者配合才能完整控制收录。

robots.txt 的高级用法:Crawl-delay 参数限制抓取间隔(部分蜘蛛支持,百度不支持),Disallow 配合通配符禁止参数页,Allow 单独放开重要目录。复杂规则写完必须用百度站长平台的 robots 检测工具逐条验证,输入典型 URL 看是否被允许,避免误封整站。

限制百度蜘蛛抓取频率_robots检测工具与收录恢复

标签:

更新时间:2026-08-27 10:28:47

上一篇:网站被360提示被挂马有风险_处理方法_恢复排名_详细教程

下一篇:MySQL ON DUPLICATE KEY UPDATE?mysql on duplicate key update用法,完整解决方案