第3 4 卷第10 期20 11年10 月合肥工业大学学报( 自然科学版)J O U R N A LO FH E F E IU N I V E R S I T YO FT E C H N O I X ) G YD o i: 10. 3969/j. issn . 1003—5060. 2011, 10 . 0 14基于语义关联的文本分类研究V 0 1. 34 N o . 100 c t. 2 0 11张浩1~,谢飞3( 1. 合肥工业大学计算机与信息学院, 安徽合肥230 0 0 9 ; 2. 皖南医学院基础医学部, 安徽芜湖24 10 0 0 l 3. 合肥师范学院计算机科学与技术系, 安徽合肥230 6 0 1)摘要: 传统的文本表示是在向量空间模型的基础上, 采用特征选择方法降低文本的维数, 这种方法认为文本中词语是相互独立的, 没有考虑彼此之间的语义信息。 文章提出一种新的基于语义特征选择的文本分类方法, 在已有特征选择的基础上, 利用词语之间的语义关联性, 将那些与已选择的词语具有密切联系的词语加入词语特征空间。 实验表明, 该方法与已有的特征选择方法比较, 提高了文本分类的精度。关键词: 文本分类; 向量李问模型; 特征选择; 语义关联中图分类号: T P 39 1文献标识码: A文章编号: 1003—5060( 2011)10—1501- 04T e x tc a te g o r iz a tio nb a se d o n se m a n tic r e la te d n e ssZ H A N GH a 0 1” . X IEF e i3( 1. S ch o o l o fC o m p u t e ra n d In f o r m a tio n . H e f e i U n iv e r sityo fT e c h n o lo g y 。 H e f e i 230 0 0 9 。 C h in a t 2 . D e p t. o fB a sic M e d ic in e 。 W a n n a nM e d ic a lC o lleg e, W u h u2410 0 0 , C h in a ; 3. D ep t. o f C o m p u te rS c ie n c ea n dT e c h n o lo g y , H e f e iN o r m a l U n iv er sity , H ef ei2 3 0 6 0 1, C h in a )A b str a c t: T r a d itio n a lt e x tr e p r e se n ta tio niS b a se d o n th e v e c t o rsp a c em o d e l th a t u s e s th e m e th o d o ff e a tu r e se le c tio n t o r e d u c e th ed im e n sio n o f th e f e a tu r esp a c e . T h ew o r d s in th e t e x t a r ec o n sid e r e d tOb e m u tu a lly in d e p e n d e n tw ith o u t a n yse m a n tic in f o r m a tio n b e tw e e n th e m . In th isp a p e r , an e wm e th —o d o f t e x tc a te g o r iz a tio nisp r o p o se db a se d o n se m a n tic f e a tu r e se le c tio n . B a se do nth e tr a d itio n a l lea —t u r e se le c tio n a n dc o n sid e r in g th e se m a n tic r e la te d n e ss b e tw e e n th ew o r d s, th o se w o r d s th a t h a v est r o n gse m a n tic r ela ted n ess w ith th etr a d itio n a llyse le c te d o n e s a r e a lso a d d e din to th e f ea tu resp a ce .T h ee x p e r im e n ta lr e su lts sh o wth a tc o m p a r e dw ith th e tra d itio n a l m e t h o d s o f f ea tu re selectio n 。 th ep r o p o se dm e th o din th ep a p e r im p r o v e s th ep r e c isio no f t e x tca teg o r iz a tio n .K e yw o r d s: te x tc a te g o r iz a tio n ; v e c to r sp a c em o d e l; f e a tu r eselectio n ; sem a n ticr e la te d n e ss0 引目随着信息技术和互联网的飞速发展, 人们可以获得越来越多的电子信息资源; 但同时也需要投入更多的时间对这些信息进行组织和管理。 为了减轻这种负担, 人们开始研究采用计算机进行文本分类。 文本分类( T e x t C a teg o riza t; o n )就是在给定的分类体系下, 让计算机根据文本的内容确定与它相关联的类别。 文本分类是自然语言处理的一个重要的问题, 主要应用于信息检索、 自动文摘、 信息过滤、 邮件分类等。文本分类中一个重要的问题是特征选择, 通过特征选择减少文本的特征向量维数, 提高分类的效率和精度。 特征选择的基本思想是构造一个评价函数, 对特征集的每个特征进行评估, 选择类别区分能力强的特征构造特征集。 已有的一些特征选择方法( 如互信息、 信息增益等)在构造特征评价函数时, 重点考虑词语与类别的关联性, 没有收稿日期: 201卜01—12基金项目: 安徽省高校自然科学研究基金资助项目( K J20 10 8 16 8 )f 安徽省高校优秀人才青年基金资助项目( 20 10 S Q R L l4 8 I2 0 10 S Q R L l4 9 Z D )作者简介: 张浩( 19 7 9 - - ). 男, 安徽阜阳人。 合肥工业大学硕£ 生, 皖南医学院讲师.万方数据