我的知识记录

中国数据虚拟主机禁止抓取动态参数配置_robots.txt写法与抓取频率

很多站长遇到禁止抓取动态参数直接在 robots.txt 写 Disallow: /,结果整站被禁止抓取,收录全部消失。robots.txt 修改前用百度站长平台的 robots 检测工具验证,确认只屏蔽了目标目录,没有误封正常内容。

robots.txt 只能禁止抓取,不能删除已收录的页面。已经被百度收录的页面,即使 robots.txt 禁止抓取,收录仍会保留(只是不再更新)。要删除收录需要页面返回 404 或 410,再在站长平台提交死链。robots.txt + 404 配合才能彻底清理。

配置参考(robots.txt 禁止指定蜘蛛): ``` User-agent: AhrefsBot Disallow: /

User-agent: SemrushBot Disallow: /

User-agent: * Allow: / ```

Disallow 路径写法错误是常见坑。Disallow: /admin 会匹配 /admin、/adminabc、/admin/xxx,要精确禁止目录用 Disallow: /admin/(带尾斜杠)。Allow 优先级在百度蜘蛛里是"最具体的规则优先",不是简单的先到先得,写复杂规则前用检测工具验证。

百度蜘蛛流量大但收录少,通常是抓取了大量低价值页面。优化方向:robots.txt 禁止搜索结果页、筛选页、分页参数、标签云;页面加 canonical 指向主版本;sitemap 只提交高质量页面。蜘蛛抓取配额集中到正文页后,收录量和排名都会提升,流量反而下降。

robots.txt 的高级用法:Crawl-delay 参数限制抓取间隔(部分蜘蛛支持,百度不支持),Disallow 配合通配符禁止参数页,Allow 单独放开重要目录。复杂规则写完必须用百度站长平台的 robots 检测工具逐条验证,输入典型 URL 看是否被允许,避免误封整站。

robots.txt 与 301、404 的配合:页面已删除不要只靠 robots 禁止,要让页面返回 404 再提交死链;页面移动到新地址用 301,不要 robots 禁止旧地址(禁止后蜘蛛不抓取,301 无法传递权重)。robots.txt 管抓取范围,301 和 404 管状态码,三者配合才能完整控制收录。

中国数据虚拟主机禁止抓取动态参数配置_robots.txt写法与抓取频率

标签:

更新时间:2026-09-02 13:41:47

上一篇:华为云ECS宝塔MySQL密码错误_bt命令解决

下一篇:日志文件占用空间_日志备份缓存目录清理