WebMagic0.7.3更新内容
本次更新增加了Downloader模块的一些功能。小马撒欢app安卓版下载-小马撒欢手机版3.3.1最新版
#609修复HttpRequestBody没有默认构造函数导致无法反序列化的bug。
#631HttpRequestBody的静态构造函数不再抛出UnsupportedEncodingException受检异常。
#571Page对象增加bytes属性,用于获取二进制数据。下载纯二进制页面时,请设置request.setBinarayContent(true),这样对于二进制内容不会尝试转换为String,减小开销。
#629在HttpUriRequestConverter中会自动对一些导致URI异常的字符进行转移或过滤。
#610自动识别编码时,可以识别Content-Type中charset为大写的情况。
#627支持为Request单独设置页面编码,兼容同一站点多种编码方式的情况。
#613Page对象增加charset属性,其值为request/site中设置的charset,或者为自动检测的charset(未定义时)。
#606升级jsonpath到2.4.0
#608升级jsoup到1.10.3
WebMagic中文版功能
WebMagic是一个简单灵活的Java爬虫框架。基于WebMagic,你可以快速开发出一个高效、易维护的爬虫。webmagic采用完全模块化的设计,功能覆盖整个爬虫的生命周期(链接提取、页面下载、内容抽取、持久化),支持多线程抓取,分布式抓取,并支持自动重试、自定义UA/cookie等功能。
WebMagic常见问题
(1)由于我这个爬虫的抓取有分页,而且它的分页通过js跳转的,抽取出来感觉有点麻烦,我想直接得到所有的信息,发现可以通过输入url地址请求得到所有的信息(这是网站的一个小问题,它没有设置每页数据记录条数的范围),但是需要登录才可以进行url地址的访问,就要使用cookie模拟登录。
(2)下面分析有关登录信息的cookie,我使用的是chrome,点击如图位置,会看到此网站的cookie,(如果已经访问了一段时间了,可以清除所有cookie然后重新登录再访问,否则可能会有很多的cookie,分析起来不方便),由于只有5个cookie,直接加上就可以访问了

WebMagic是java上面经常的需要的一款爬虫类型的工具了,现在就可以试试最新的0.7.3版本,功能以及使用上面都是完全的免费的,欢迎大家试试!
展开

别样海外直购app-别样时尚购app1.68.0 苹果手机版
myOffer海外大学智能申请平台2.4.8 留学生版
明日求生之王游戏下载-明日求生之王1.0.1 安卓版
菇勇者传说游戏下载-菇勇者传说手游3.1.12 官方最新版
幻世录黑暗再临1.22正式版地图下载
致青春字体素材-致青春字体psd最新免费版
198热血海贼王登录器-198热血海贼王微端1.0 官网最新版 【白金新手礼包】
夏之光写真壁纸-夏之光图片高清壁纸精选免费版
勇敢者西游礼包码2020-勇敢者西游礼包福利版1.0 折扣版
11j515图集免费下载-西南11J515室内装修图集pdf清晰版【西南图集11j515】
公主连接抽奖码-公主连结兑换码3.4.10免费版
联通沃音乐app下载-沃音乐手机版6.0.3官方苹果版
托卡小镇学校生活游戏下载-托卡小镇学校生活1.6最新版
solidworks 2008 中文破解补丁
移动找兼职软件-移动的社会实践共享平台(忙起来 app)2.1.14 应聘版
魔性机器人网页代码免费下载
优酷hd版本下载 -优酷hd安卓版5.0.0 最新版
赚够100亿游戏免广告下载-赚够100亿游戏无限金币版1.0.2 解锁版
食卡卡app下载官方版本-食卡卡1.9.2 手机版
豪情水浒九游下载-豪情水浒九游版1.12.0 安卓最新版