188宝金博页面版

  • 图案背景
  • 纯色背景
视图
标记
批注
批注本地保存成功,开通会员云端永久保存 去开通
fuzhousea

上传于:2011-11-11

粉丝量:0

该文档贡献者很忙,什么也没留下。


  • 相关
  • 目录
  • 笔记
  • 书签

188宝金博页面版:更多相关文档

  • 基于特征句抽取的网页去重研究

    星级: 6 页

  • 基于特征句抽取的网页去重研究

    星级: 6 页

  • 基于特征句抽取的网页去重研究

    星级: 6 页

  • 基于特征句抽取的网页去重研究论文

    星级: 6 页

  • 基于特征句抽取的网页去重研究论文

    星级: 6 页

  • 基于特征码的网页去重基于去重网页去重基于网页网页

    星级: 4 页

  • 基于特征码的网页去重

    星级: 3 页

  • 基于网页正文结构和特征串的相似网页去重算法

    星级: 1 页

  • 基于特征码的网页去重算法研究

    星级: 3 页

  • 基于特征码的网页去重算法研究

    星级: 3 页

  • 基于特征码的网页去重算法研究

    星级: 3 页

  • 基于特征码的网页去重(精)

    星级: 4 页

  • 基于特征串的网页去重算法

    星级: 2 页

  • 基于视觉特征的网页信息抽取方法研究的开题报告.docx

    星级: 2 页

  • 一种基于文本抽取的网页正文去重算法

    星级: 2 页

暂无目录

点击鼠标右键菜单,创建目录

暂无笔记

选择文本,点击鼠标右键菜单,添加笔记

暂无书签

在左侧文档中,点击鼠标右键,添加书签

188宝金博页面版: 基于特征句抽取的网页去重研究

下载积分: 1000

内容提示: 基于特征句抽取的网页去重研究*彭渊赵铁军郑德权于浩哈尔滨工业大学语言语音188宝金博页面版部一 微软重点实验室 黑龙江 哈尔滨150001E-mail: pengyuan(a mtlab.hit.edu.cn摘 要: 去除重复网页一直是信息检索领域的一个待解决的问题。本文基于双语文章的内容, 提出了一种抽取特征词和特征句, 判别跨语言重复网页的方法。并将其运用到了跨语言的重复网页的识别上. 实验结果表明:该方法对双语重复网页的识别准确率在 86%以 上,对单语重复网页的识别准确率在 97.5%以上,达到了实用的程度,同时,该方法对于双语平行语料的自动挖掘也有一定的帮助。关键词: 网页去重,特征词,...

文档格式:PDF | 页数:6 | 浏览次数:20 | 上传日期:2011-11-11 15:19:41 | 文档星级:
基于特征句抽取的网页去重研究*彭渊赵铁军郑德权于浩哈尔滨工业大学语言语音188宝金博页面版部一 微软重点实验室 黑龙江 哈尔滨150001E-mail: pengyuan(a mtlab.hit.edu.cn摘 要: 去除重复网页一直是信息检索领域的一个待解决的问题。本文基于双语文章的内容, 提出了一种抽取特征词和特征句, 判别跨语言重复网页的方法。并将其运用到了跨语言的重复网页的识别上. 实验结果表明:该方法对双语重复网页的识别准确率在 86%以 上,对单语重复网页的识别准确率在 97.5%以上,达到了实用的程度,同时,该方法对于双语平行语料的自动挖掘也有一定的帮助。关键词: 网页去重,特征词,特征句,跨语言R esearch on D eletion of F eature Sentence E xtr action B ased Dupl i cated Web PagesPeng Yuan, Zhao Tie jun, Zheng Dequan, Yu HaoAbstract: Deletion of duplicated web pages has been one of the problems that need to be solved in informationretrieval. In this paper, according to the word f r equency statistical theor y , we put forward a duplicated web pagesrecognition algorithm by extracting feature words and feature sentences of web documents. We apply this approachin the recognition of cross language duplicated web pages. Experimental results show that this algorithm can reach aprecision of 97.5% in mono-language deletion of duplicated web pages, and this algorithm can also reach amaximum precision of 86% when it is applied to deletion of duplicated web pages for cross language. This algorithmcan also do some help to the automatic mining of parallel corpus f r om the inter net.Keywords: Deletion of duplicated web pages, Feature word, Feature sentence, Cross-language1引言 随着信息时代的到来,以及越来越高的网络使用率,互联网上的信息也越来越多,人们也越来越依靠搜索引擎来在互联网 上寻找自 己 所需要的信息. 根据 netcraf tl7 l 的统计, 截止到2005年4月, 世界上共统计到62, 286, 451个网站记录. 而且还在以 每月数以 百万计的数量增长。同时,这些网站所提提供的信息也以 T ( 1 T=1000G) 来计算。面对着如此多的海量信息, 如果需要找到自己需要的相应的信息, 需要费很大的精力, 于是搜索引擎就成为了用户寻找自己所需要的信息的首选工具。用户对于搜索引擎的急切需求促进了搜索引擎的蓬勃发展,‘ 本 文 承 国 家 自 然 科 学 基 金 (N o :6 0 3 0 2 0 21 )和 黑 龙 江 省 自 然 科 学 荃 金 ( (N o :F2 0 0 4 -0 4 )的 资 助-508-

188宝金博页面版:关注我们

  • 新浪微博

关注188宝金博页面版公众号

188宝金博页面版
阅读
APP
阅读
返回
顶部
188宝金博页面版官网登录在线平台入口(2026已更新)—江苏协昌电子科技股份有限公司