- 相关
- 目录
- 笔记
- 书签
188宝金博页面版:更多相关文档
-
基于特征句抽取的网页去重研究
星级: 6 页
-
基于特征句抽取的网页去重研究
星级: 6 页
-
基于特征句抽取的网页去重研究
星级: 6 页
-
基于特征句抽取的网页去重研究论文
星级: 6 页
-
基于特征句抽取的网页去重研究论文
星级: 6 页
-
基于特征码的网页去重基于去重网页去重基于网页网页
星级: 4 页
-
基于特征码的网页去重
星级: 3 页
-
基于网页正文结构和特征串的相似网页去重算法
星级: 1 页
-
基于特征码的网页去重算法研究
星级: 3 页
-
基于特征码的网页去重算法研究
星级: 3 页
-
基于特征码的网页去重算法研究
星级: 3 页
-
基于特征码的网页去重(精)
星级: 4 页
-
基于特征串的网页去重算法
星级: 2 页
-
基于视觉特征的网页信息抽取方法研究的开题报告.docx
星级: 2 页
-
一种基于文本抽取的网页正文去重算法
星级: 2 页
暂无目录
暂无笔记
暂无书签
188宝金博页面版: 基于特征句抽取的网页去重研究
内容提示: 基于特征句抽取的网页去重研究*彭渊赵铁军郑德权于浩哈尔滨工业大学语言语音188宝金博页面版部一 微软重点实验室 黑龙江 哈尔滨150001E-mail: pengyuan(a mtlab.hit.edu.cn摘 要: 去除重复网页一直是信息检索领域的一个待解决的问题。本文基于双语文章的内容, 提出了一种抽取特征词和特征句, 判别跨语言重复网页的方法。并将其运用到了跨语言的重复网页的识别上. 实验结果表明:该方法对双语重复网页的识别准确率在 86%以 上,对单语重复网页的识别准确率在 97.5%以上,达到了实用的程度,同时,该方法对于双语平行语料的自动挖掘也有一定的帮助。关键词: 网页去重,特征词,...
阅读了该文档的用户还阅读了这些文档
-
188宝金博页面版: Android DEX安全攻防战
-
188宝金博页面版: 关于安卓手机木马的编程
-
188宝金博页面版: 隐蔽信道研究
-
188宝金博页面版: 基于HTTP协议的隐蔽信道研究
-
188宝金博页面版: 基于HTTP协议的网络隐蔽通道研究
-
188宝金博页面版: 基于元搜索引擎的危机信息监控系统的研究与实现
-
188宝金博页面版: 基于搜索引擎的有害信息监控系统的设计与实现
-
188宝金博页面版: 大规模网页快速去重算法
-
188宝金博页面版: 基于特征句抽取的网页去重研究
-
188宝金博页面版: 基于神经网络分类的搜索引擎在Internet信息监控中的应用
