Java爬虫问题，网页核心文案是js动态获取的，如何使用java获取？_数字化

即使js动态获取，他也是有一个请求地址的，你可以通过chrome或fireFox的调试功能把他找到！按F12，然后在控制台打开后刷新页面！控制台会显示所有的网络调用地址！你找一下就有了！然后你按他的格式get或post到这个地址就能拿到数据了！（登录用户的话记得带上cookie）

一、需求

1定时抓取固定网站新闻标题、内容、发表时间和来源。

2程序需要支持分布式、多线程

二、设计

1网站是固定，但是未来也可能添加新的网站去抓取，每个网站内容节点设计都不一样，这样就需要支持动态可配置来新增网站以方便未来的扩展，这样就需要每次都需要开发介入。

2网站html节点的结构可能发生变化，所以也要支持提取节点可配置。

3怎样支持分布式？暂时最简单的想法就是：多机器部署程序，还有新搞一台或者部署程序其中一台制作一个定时任务，定时开启每台机器应该抓取哪个网站，暂时不能支持同一个网站同时可以支持被多台机器同时抓取，这样会比较麻烦，要用到分布式队列。所以暂时一个网站同时只会被单台机器抓取。

4多线程，怎样多线程？多线程抓取我这边有两个实现：

（1）一个线程抓取一个网站，维护一个自己的url队列做广度抓取，同时抓取多个网站。如图：

（2）多个线程同时抓取不同的网站。如图：

以上两张办法其实各有优点，也给有缺点，看我们怎么取舍了。

方法1：每个线程创建一个自己的队列，图中的queue可以不用concurrentQueue，优点：不涉及到控制并发，每个网站一个线程抓取一个网站，抓取完毕即自动回收销毁线程。控制方便。缺点：线程数不可以扩展，例如当只有3个网站，你最多只能开3个线程来抓取，不能开更多，有一定的局限性。

方法2：N个线程同时抓取N个网站，线程数和网站数目不挂钩，优点：线程数可以调整并且和和抓取网站数量无关。3个网站我们可以开4个5个或者10个这个可以根据您的硬件资源进行调整。缺点：需要控制并发，并且要控制什么时候销毁线程（thread1空闲，并且queue为空不代表任务可以结束，可能thread2结果还没返回），当被抓取的网站响应较慢时，会拖慢整个爬虫进度。

三、实现

抓取方式最终还是选择了方法二，因为线程数可配置！

使用技术：

jfinal用了之后才发现这东西不适合，但是由于项目进度问题，还是使用了。

maven项目管理

jettyserver

mysql

eclipse开发

项目需要重点攻破的难点：

（1）合理的控制N个线程正常的抓取网站，并且当所有线程工作都完成了并且需要抓取的队列为空时，N个线程同时退出销毁。

（2）不同网站设计节点不一样，需要通过配置解决各个网站需要抓取的URL和抓取节点内容在html节点的位置。

（3）个性化内容处理，由于html结构设计问题，北大青鸟认为抓取的内容可能有些多余的html标签，或者多余的内容该怎么处理。

欢迎分享，转载请注明来源：内存溢出

原文地址:https://54852.com/zaji/12459794.html

Java爬虫问题，网页核心文案是js动态获取的，如何使用java获取？

发表评论

评论列表（0条）