打开APP
userphoto
未登录

开通VIP,畅享免费电子书等14项超值服

开通VIP
ROBOTSTXT_OBEY = False 粗解
  • 爬虫协议,即 robots 协议,也叫机器人协议
    它用来限定爬虫程序可以爬取的内容范围
    通常写在 robots.txt 文件中

  • 该文件保存在网站的服务器上
    爬虫程序访问网站时首先查看此文件

  • 在 scrapy 项目的 settings.py 文件中
    默认 ROBOTSTXT_OBEY = True ,即遵守此协议
    当爬取内容不符合该协议且仍要爬取时
    设置 ROBOTSTXT_OBEY = False ,不遵守此协议


转自:https://www.jianshu.com/p/19c1ea0d59c2

本站仅提供存储服务,所有内容均由用户发布,如发现有害或侵权内容,请点击举报
打开APP,阅读全文并永久保存 查看更多类似文章
猜你喜欢
类似文章
第 0 关、初识爬虫
用了二十多年了,Google终于开始推进这个互联网基石之一的协议标准化
百度为限制360搜索发展 歧视性引用robots协议
heritrix设置取消robots.txt限制
robots协议_SEO术语解析
SEO之robots.txt爬虫协议
更多类似文章 >>
生活服务
热点新闻
分享 收藏 导长图 关注 下载文章
绑定账号成功
后续可登录账号畅享VIP特权!
如果VIP功能使用有故障,
可点击这里联系客服!

联系客服