188宝金博页面版

  • 图案背景
  • 纯色背景
视图
标记
批注
批注本地保存成功,开通会员云端永久保存 去开通
uk3632

上传于:2016-05-03

粉丝量:5

机械专业,具有良好的动手能力,工作踏实、有责任心、认真严谨、一丝不苟。


  • 相关
  • 目录
  • 笔记
  • 书签

188宝金博页面版:更多相关文档

  • 基于LSI和SVM相结合的文本分类研究

    星级: 3 页

  • 一种基于SVM的主动学习文本分类方法

    星级: 3 页

  • 决策树与SVM相结合的影像分类方法研究_李琳

    星级: 44 页

  • 贝叶斯与k-近邻相结合的文本分类方法

    星级: 4 页

  • SVM 和K-means 结合的文本分类方法研究

    星级: 4 页

  • 带有云化核函数的SVM文本分类方法

    星级: 3 页

  • 基于SVM和概率统计的文本分类方法研究

    星级: 5 页

  • SVM和K-means结合的文本分类方法研究

    星级: 4 页

  • SVM和TF_RF的文本分类方法

    星级: 5 页

  • 一种集成本体和SVM的文本分类方法

    星级: 5 页

  • 基于LASVM-NC和TF.RF的文本分类方法,基于LASVM-NC和TF.RF的文本分类方法

    星级: 6 页

暂无目录

点击鼠标右键菜单,创建目录

暂无笔记

选择文本,点击鼠标右键菜单,添加笔记

暂无书签

在左侧文档中,点击鼠标右键,添加书签

188宝金博页面版: CTM与SVM相结合的文本分类方法 

下载积分: 685

内容提示: 第36卷场1.36第22期No.22计算机工程Computer Engi neeri ng2010年11月November 2010· 人工智能及识别技术·文章编号,l oo¨ 羽勰(20l o)22-m饿卜03CTM与SVM相结合的文本分类方法王燕霞,邓伟( 苏州大学计算机科学与技术学院,江苏苏州215006)I要:研究一种相关主题模型( CTM) 与支持向晕机fSVM) 相结合的文本分类方法。该方法用CTM对数据集建模以降低数据的维度,甩SVM对简化后的文本数据进行分类。为使CTM模型能够较好地对数据集进行建模,在该方法中用DBSCAN聚类方法对数据进行聚类,根据聚类所得到的聚类中心点数目确定CTM模型的主题参数。实验结果表明,该方法可...

文档格式:PDF | 页数:3 | 浏览次数:37 | 上传日期:2016-05-03 08:00:42 | 文档星级:
第36卷场1.36第22期No.22计算机工程Computer Engi neeri ng2010年11月November 2010· 人工智能及识别技术·文章编号,l oo¨ 羽勰(20l o)22-m饿卜03CTM与SVM相结合的文本分类方法王燕霞,邓伟( 苏州大学计算机科学与技术学院,江苏苏州215006)I要:研究一种相关主题模型( CTM) 与支持向晕机fSVM) 相结合的文本分类方法。该方法用CTM对数据集建模以降低数据的维度,甩SVM对简化后的文本数据进行分类。为使CTM模型能够较好地对数据集进行建模,在该方法中用DBSCAN聚类方法对数据进行聚类,根据聚类所得到的聚类中心点数目确定CTM模型的主题参数。实验结果表明,该方法可以加快分类速度并提高分类精度。关健诃:文本分类;相关主题模型;聚类;支持向量机Text Cl assi fi cati on MethodWANG Yah- xi a.DENG( School of Computer Sci ence and Technol ogy, SoochowIAbstractlA text cl assi fi cati on methodcombi ni ngCorrel ated Topi c ModeI( CTM) andreduce the corpus’s di mensi on,thi s method model s the corpus,and cl assi fi esmodel the corpus better, DBSCAN cl usteri ng method i s used and choosesresul t shows that the method can accel erate the cl assi fi cati on sp髓d and i mwoveIKey wordsitext cl assi fi cati on;Correl ated Topi c Model ( CTM) ;cl usteri ng;SVMl 概述随着信息技术的发展,大量以文本形式存在的信息涌现到互联网上,文本分类作为信息检索与数据挖掘领域的研究热点与核心技术,近年来得到了广泛关注和快速发展? 。为了得到更好的分类效果,文本表示成了文本分类研究中的一个很重要的部分。长期以来文本表示的主要方法是直接采用向鼍空间模型( VectorSpace Model ,VSM) 。近年来以隐含狄利克雷分配(LatentDi ri chl et Al l ocati on,LDA) 为代表的主题模型作为一种新的文本表示方法得到了深入的研究与应用¨ J 。该模型主要应用在文本分类、信息提取、电子邮件分类、图像聚类、字符分类等方面。LDA模型假设主题之间是相互独立的,然而,这种假设与真实数据集中的实际很不符合。为了克服这个缺陷,Bl ei· 在2006年提出了相关主题模型( Correl ated Topi c Model ,CTM) ” J ,该模型从Logi sti c Normal 分布中提取主题,克服了LDA模型不能提取文本间相关信息的缺陷。这一模型一经提出便在提取科学主题和图像提取中得到了成功的应用。SVM是近几年来在机器学习领域中出现的新的研究热点,它是由Vapni k领导的AT&TBel l 实验室研究小组提出的一种新的非常有潜力的分类技术14J 。它以统计学习理论为基。诨诮峁狗缦兆钚』蛏,有效地避免经典学习方法中过学习、维数灾难、局部极小等传统分类存在的问题,在小样本条件下仍然具有良好的泛化能力,已经成功地应用在垃圾邮件过滤领域陋l 。本文将CTM与SVM相结合提出一种文本分类方法。2CTM模型CTM模型是LDA模型的一种改进模型,它从Logi sti cNormal 分布中提取隐含主题。CTM的图形表示如图l 所示。示从主题分布中反复抽样产生文档d的词({Wl ,W2,?,WN” 。给定一个文档集合D,包含M个文档和y个不同的词。每个文档d包含一个词序列{w,-,W2。?,wⅣl 。在集合D对应的CTM模型中,假设主题数目固定为k,则一个文档d的产生可以表示为以下2个过程:( 1) 从Logi sti c Normal 分布p(节,肛三)中随机选择一个k维的向最和,表示文档d中的主题混合比例。( 2) 根据特定的主题比例对文档d中的词进行反复抽样,得到p( 胁,班,励。其中,,f是k维的均值向量,三是KxK的协方差矩阵。主题数k值对模型推断出的主题分配比例影响很大。根据聚类中的簇和主题模型中的主题的相似性。对数据集中的特征词用DBSCANl 61方法进行聚类,根据得到的聚类中心点数目确定主题女值。作者倚介:壬燕霞(1982一),女,硕士研究生,主研方向:智能化信息处理;邓伟,剐教授、博士收藕日期:2010-04-11E- mai h 20074227065064@suda.edu.cn

188宝金博页面版:关注我们

  • 新浪微博

关注188宝金博页面版公众号

188宝金博页面版
阅读
APP
阅读
返回
顶部
188宝金博页面版官网登录在线平台入口(2026已更新)—江苏协昌电子科技股份有限公司