精选优质文档-倾情为你奉上网页去重的策略和实现0 引言互联网时代的到来,极大地影响了人们的日常生活,改变着人类的生活习惯。同时,也给人们带来了极大的便利。人们越来越喜欢通过搜索引擎来查找自己想要得到的内容和信息,这是搜索引擎技术的机遇,然而也是挑战,因为人们的要求也越来越苛刻。在我们用搜索引擎搜索信息的时候,常常会遇到这样一种情况:很多内容相同或相似的网页会被搜索引擎提交给我们。这对用户来说,是很不便利的,不仅浪费了时间,也占用了大量的资源。同时,也降低了搜索引擎的服务效率。因而网页去重技术也慢慢被人们重视起来。网页去重的算法有很多种,本文重点介绍一种基于网页中文字主题要素的网页去重算法。1网页去重的理论基础1.1搜索引擎搜索引擎是指根据一定的策略、运用特定的计算机程序从互联网上搜集信息,在对信息进行组织和处理后,为用户提供检索服务,将用户检索相关的信息展示给用户的系统。搜索引擎包括全文索引、目录索引、元搜索引擎、垂直搜索引擎、集合式搜索引擎、门户搜索引擎与免费链接列表等。搜索引擎的工作原理:第一步:爬行搜索引擎是通过一种特定规律的软件跟踪网