爬虫解决网页重定向问题

更新日期: 2019-01-01 阅读: 5.7k 标签: 爬虫分享

笔者编写的搜索引擎爬虫在爬取页面时遇到了网页被重定向的情况，所谓重定向(Redirect)就是通过各种方法（本文提到的为3种）将各种网络请求重新转到其它位置（URL）。每个网站主页是网站资源的入口，当重定向发生在网站主页时，如果不能正确处理就很有可能会错失这整个网站的内容。笔者编写的爬虫在爬取网页时遇到了三种重定向的情况。

1.服务器端重定向，在服务器端完成，一般来说爬虫可以自适应，是不需要特别处理的，如响应代码301（永久重定向）、302（暂时重定向）等。具体来说，可以通过requests请求得到的response对象中的url、status_code两个属性来判断。当status_code为301、302或其他代表重定向的代码时，表示原请求被重定向；当response对象的url属性与发送请求时的链接不一致时，也说明了原请求被重定向且已经自动处理。

2.meta refresh，即网页中的<meta>标签声明了网页重定向的链接，这种重定向由浏览器完成，需要编写代码进行处理。例如，某一重定向如下面的html代码第三行中的注释所示，浏览器能够自动跳转，但爬虫只能得到跳转前的页面，不能自动跳转。

<html>
  <head>
  <meta http-equiv="refresh" content="0.1;url=http://www.redirectedtoxxx.com/"><!--本网页会在0.1秒内refresh为url所指的网页-->
  </head>
</html>

解决办法是通过得到跳转前的页面源码，从中提取出重定向url信息（上述代码第三行中的url属性值）。一个具体的操作：

①使用xpath('//meta[@http-equiv="refresh" and @content]/@content')提取出content的值
②使用正则表达式提取出重定向的url值。

3.js 重定向，通过JavaScript代码形式进行重定向。如下面JavaScript代码

<script language=javascript>window.location.href='http://www.redirectedtoxxx.com'</script>

对于这种方式的跳转，由于可以实现该功能的JavaScript语句有多种形式，不能再使用正则表达式提取url，只能考虑加载JavaScript代码来进行解决。

本文内容仅供个人学习、研究或参考使用，不构成任何形式的决策建议、专业指导或法律依据。未经授权，禁止任何单位或个人以商业售卖、虚假宣传、侵权传播等非学习研究目的使用本文内容。如需分享或转载，请保留原文来源信息，不得篡改、删减内容或侵犯相关权益。感谢您的理解与支持！

链接: https://fly63.com/article/detial/1739

上一页: 优化 MP4 视频以便更快的网络串流下一页: kubernetes之Flannel网络插件部署

内容以共享、参考、研究为目的,不存在任何商业目的。其版权属原作者所有,如有侵权或违规,请与小编联系!情况属实本人将予以删除!

爬虫解决网页重定向问题

爬虫最终杀手锏 --- PhantomJS 详解（附案例）

网络爬虫_基于各种语言的开源网络爬虫总汇

爬虫解决网页ip限制的问题的八种方法

web爬虫抓取技术的门道,对于网络爬虫技术的攻与防

到百度云加速，网页内容爬不到的快速解决

网络爬虫程序员被抓，我们还敢爬虫吗？

反爬经验与理论基础

大话爬虫的实践技巧

node.js主从分布式爬虫

什么是网络爬虫，网络爬虫有什么用？

爬虫解决网页重定向问题

爬虫最终杀手锏 --- PhantomJS 详解（附案例）

网络爬虫_基于各种语言的开源网络爬虫总汇

爬虫 解决网页ip限制的问题的八种方法

web爬虫抓取技术的门道,对于网络爬虫技术的攻与防

到百度云加速，网页内容爬不到的快速解决

网络爬虫程序员被抓，我们还敢爬虫吗？

反爬经验与理论基础

大话爬虫的实践技巧

node.js主从分布式爬虫

什么是网络爬虫，网络爬虫有什么用？

爬虫解决网页ip限制的问题的八种方法