IP代理软件,http代理,API提取-黑洞HTTP

黑洞HTTP

您的位置: 首页 > 新闻资讯 > HTTP代理 > 正文

代理IP可以帮助猫眼电影、美团、去哪儿等网站反击爬虫吗?

发布时间:2019年04月11日 来源:互联网

代理IP可以帮助猫眼电影、美团、去哪儿等网站反击爬虫吗?谈到反爬虫,或许你最先想起的是User-Agent+ Referer检测、验证码、ip访问速度、账号及cookie验证等,这类反爬虫对大家而言根本没有难度可言,完全能利用代理ip加其它的一些措施实现完美的伪装,接近于真实用户浏览的,可是,别以为这样就没有后顾之忧了,一起来看下脑洞大开的前端工程师的反爬虫措施吧。



一、 FONT-FACE拼凑式


范例:猫眼电影


猫眼电影网站,针对票房信息等展示的并非纯粹的数字。


网页采用font-face定义了字符集,并利用unicode去映射呈现。换句话说,去掉图像识别,必须同时抓取字符集,才能分辨出数字。


而且,每次页面刷新,字符集的url都会发生改变的,显然更大强度地提高了爬取成本。


二、BACKGROUND拼凑式


范例:美团


与font的方式差不多,美团里采用的是background拼凑。数字其实是图片,按照不同的background偏移,显示出不一样的字符。


而且不同页面,图片的字符排序都是有差异的。不过理论上只需生成0-9与小数点,为什么有重复字符还没有搞明白。


三、字符穿插式


范例:微信公众号文章


一些微信公众平台的文章里,穿插了各类迷之字符,而且按照样式把这些字符隐藏掉。


这类方式尽管惨绝人寰…但我觉得找不到太大的识别与过滤难度,甚至能够做得更好,不过也算作一种脑洞吧。


四、伪元素隐藏式


范例:汽车之家


汽车之家网站里,将关键的厂商数据,做到了伪元素的content里。


这又是一种策略:爬取网页,一定得解析css,还要拿到伪元素的content,这就提高了爬取的难度。


五、元素定位覆盖式


范例:去哪儿


酷爱数学的去哪儿,针对一个4位数的票价,首先用4个i标签渲染,然后2个b标签去绝对定位偏移量,覆盖有意呈现错误的i标签,最终在视觉上建立正确的价格…


这就表明爬虫能解析css还不够,还要会做数学题。


六、IFRAME异步加载式


范例:网易云音乐


网易云音乐网页一打开,html源码里基本上只有一个iframe,而且它的src是空白的:about:blank。接着js开始运行,把整个页面的框架异步塞到了iframe里面…


不过这一方法造成的难度并不大,仅仅在异步与iframe处理上绕了个弯,不管你是用selenium还是phantom,都有API能够拿到iframe里面的content数据。


七、字符集替换式


范例:去哪儿移动版


一样会欺骗爬虫的还有去哪儿的移动版。


html里明明写的3211,视觉上呈现的却是1233。原来他们重新定义了字符集,3与1的顺序刚好调换得来的结果…


相关文章内容简介

1 代理IP可以帮助猫眼电影、美团、去哪儿等网站反击爬虫吗?

代理IP可以帮助猫眼电影、美团、去哪儿等网站反击爬虫吗?谈到反爬虫,或许你最先想起的是User-Agent+ Referer检测、验证码、ip访问速度、账号及cookie验证等,这类反爬虫对大家而言根本没有难度可言,完全能利用代理ip加其它的一些措施实现完美的伪装,接近于真实用户浏览的,可是,别以为这样就没有后顾之忧了,一起来看下脑洞大开的前端工程师的反爬虫措施吧。一、 FONT-FACE拼凑式范例:猫眼电影猫眼电影网站,针对票房信息等展示的并非纯粹的数字。网页采用font-face定义了字符集,并利用unicode去映射呈现。换句话说,去掉图像识别,必须同时抓取字符集,才能分辨出数字。而且,每次页面刷新,字符集的url都会发生改变的,显然更大强度地提高了爬取成本。二、BACKGROUND拼凑式范例:美团与font的方式差不多,美团里采用的是background拼凑。数字其实是图片,按照不 [阅读全文]

热门标签

最新标签

推荐阅读

  1. 24

    2019-10

    国内的代理ip有什么优缺点?

    生活工作中,如果ip被限制,就十分营销我们的效率,幸好有代理IP软件,代理ip是可以提供固定或者动态IP的工具,可以解决很多IP限制问题,例如爬

  2. 20

    2019-03

    代理ip中的爬虫功能可以做哪些有意思的事?

    作为一家大数据公司的小编,每天的日常就是“爬爬爬”,很多人并不了解爬虫,觉得爬虫没什么用,今天就让小编来告诉大家,爬虫能做什么有趣的事。

  3. 18

    2019-04

    代理IP如何爬虫帮助爬取到网页的源代码?

    今天我们就来看下,爬虫是如何爬取到网页源代码的。这里我们就以极光爬虫网站为例,来爬取网站的源代码,并把代码保存到本地。爬取时,需要用到python的urllib模块,具体代码如下:

  4. 02

    2019-07

    为什么使用HTTP代理IP还是被封呢?

    网络爬虫在如今的互联网领域有着特别的意义,比如我们耳熟能详的大数据,它的发展就离不开网络爬虫。然而网络爬虫也是有天敌的,那就是目标网站的反爬虫策略,爬虫在工作过程中要时刻

  5. 15

    2019-06

    代理IP如何解决爬虫的IP地址受限问题?

    一些网站为了控制流量和防止网站被攻击,因此会设置单ip一分钟内允许的最大请求数。当我们在访问目标网站进行数据抓取时,ip访问过于频繁,就会出现被禁止访问的情况。那么如何解决

  6. 22

    2019-08

    免费的ip代理服务器能不能够用?

    虽然很多人都比较喜欢贪小便宜,但是涉及到网络技术安全问题的时候,大家还是会显得尤其的小心谨慎,尤其是大家在听说了一些免费的ip代理服务器的时候就会觉得非常的不安。