网络爬虫的设计与实现-毕业论文.doc

上传人:sk****8 文档编号:4357186 上传时间:2019-10-25 格式:DOC 页数:63 大小:652KB
下载 相关 举报
网络爬虫的设计与实现-毕业论文.doc_第1页
第1页 / 共63页
网络爬虫的设计与实现-毕业论文.doc_第2页
第2页 / 共63页
网络爬虫的设计与实现-毕业论文.doc_第3页
第3页 / 共63页
网络爬虫的设计与实现-毕业论文.doc_第4页
第4页 / 共63页
网络爬虫的设计与实现-毕业论文.doc_第5页
第5页 / 共63页
点击查看更多>>
资源描述

摘要 摘要 网络爬虫是一种自动搜集互联网信息的程序。通过网络爬虫不仅能够为搜 索引擎采集网络信息,而且可以作为定向信息采集器,定向采集某些网站下的 特定信息,如招聘信息,租房信息等。 本文通过 JAVA 实现了一个基于广度优先算法的多线程爬虫程序。本论文 阐述了网络爬虫实现中一些主要问题:为何使用广度优先的爬行策略,以及如 何实现广度优先爬行;为何要使用多线程,以及如何实现多线程;系统实现过 程中的数据存储;网页信息解析等。 通过实现这一爬虫程序,可以搜集某一站点的 URLs,并将搜集到的 URLs 存入数据库。 【关键字】网络爬虫;JAVA;广度优先;多线程。 ABSTRACT II ABSTRACT SPIDER is a program which can auto collect informations from internet. SPIDER can collect data for search engines, also can be a Directional information collector, collects specifically inform

展开阅读全文
相关资源
相关搜索

当前位置:首页 > 重点行业资料库 > 自然科学

Copyright © 2018-2021 Wenke99.com All rights reserved

工信部备案号浙ICP备20026746号-2  

公安局备案号:浙公网安备33038302330469号

本站为C2C交文档易平台,即用户上传的文档直接卖给下载用户,本站只是网络服务中间平台,所有原创文档下载所得归上传人所有,若您发现上传作品侵犯了您的权利,请立刻联系网站客服并提供证据,平台将在3个工作日内予以改正。