联系人:白女士
联系方式:18748102550
联系地址:呼和浩特市赛罕区展西路西侧新公馆商务写字楼12层
类型:专利
金额:100000
内容:一种基于内容的垃圾网页检测方法及其检测装置,方法包括:计算所有网页与种子垃圾网页的内容最大相似度值,生成相似度集合;利用PageRank算法对所有网页进行降序排序;基于排序结果,从相似度集合中查寻网页与种子垃圾网页间的内容相似度值;比较相似度值与相似度阈值,对网页进行检测,并将检测出的垃圾网页加入到垃圾网页集合中。装置包括:生成模块、排序模块、查询模块和检测模块,通过这些模块,本发明在传统的PageRank算法基础上加入对网页内容相似度的判定,把网页的链接与内容结合起来,对垃圾网页进行检测,以此提高了垃圾网页检测的准确度和效率。