188宝金博页面版

  • 图案背景
  • 纯色背景
视图
标记
批注
批注本地保存成功,开通会员云端永久保存 去开通
mxytpxpu

上传于:2017-02-24

粉丝量:3

该文档贡献者很忙,什么也没留下。


  • 相关
  • 目录
  • 笔记
  • 书签

188宝金博页面版:更多相关文档

  • 基于聚类和信息熵的特征选择算法

    星级: 4 页

  • 基于聚类和信息熵的特征选择算法

    星级: 4 页

  • [精品]基于样本加权的可能性:劾嗨惴ň劾嗨惴ɑ诰劾嗨惴ɑ诩尤:

    星级: 5 页

  • 基于样本加权的文本聚类算法研究

    星级: 7 页

  • 基于质心的样本加权聚类算法

    星级: 3 页

  • 基于样本加权的文本聚类算法研究

    星级: 7 页

  • 基于样本加权的文本聚类算法研究

    星级: 8 页

  • 基于样本加权的文本聚类算法研究

    星级: 7 页

  • 基于样本加权的文本聚类算法研究

    星级: 8 页

  • 基于质心de样本加权聚类算法

    星级: 3 页

  • 基于加权策略的特征选择对聚类算法的改进

    星级: 5 页

暂无目录

点击鼠标右键菜单,创建目录

暂无笔记

选择文本,点击鼠标右键菜单,添加笔记

暂无书签

在左侧文档中,点击鼠标右键,添加书签

188宝金博页面版: 基于密度聚类和样本加权信息熵的特征选择算法

下载积分: 1500

内容提示: 2016 年 12 月第 31 卷 第 4 期山 东 师 范 大 学 学 报 (自 然 科 学 版)Journal of Shandong Normal University(Natural Science)Dec. 2016Vol. 31 No. 4收稿日期:2016 -05 -06* 国家自然科学基金资助项目(61170145).**通讯作者,男,教授,博士生导师.基于密度聚类和样本加权信息熵的特征选择算法*王永欣 1),2) 张化祥 1),2)**(1)山东师范大学信息科学与工程学院,250014,济南; 2)山东省分布式计算机软件新技术重点实验室,250014,济南 )摘要 特征选择是机器学习和模式识别领域中的一个重要问题. 本文提出一种非监督的特征选择算法,称为基于密度聚类和样本加权信息熵的特征选...

文档格式:PDF | 页数:5 | 浏览次数:65 | 上传日期:2017-02-24 20:48:41 | 文档星级:
2016 年 12 月第 31 卷 第 4 期山 东 师 范 大 学 学 报 (自 然 科 学 版)Journal of Shandong Normal University(Natural Science)Dec. 2016Vol. 31 No. 4收稿日期:2016 -05 -06* 国家自然科学基金资助项目(61170145).**通讯作者,男,教授,博士生导师.基于密度聚类和样本加权信息熵的特征选择算法*王永欣 1),2) 张化祥 1),2)**(1)山东师范大学信息科学与工程学院,250014,济南; 2)山东省分布式计算机软件新技术重点实验室,250014,济南 )摘要 特征选择是机器学习和模式识别领域中的一个重要问题. 本文提出一种非监督的特征选择算法,称为基于密度聚类和样本加权信息熵的特征选择算法(DCWIE). 不同于传统的基于信息熵的特征选择算法,DCWIE 使用一种加权的信息熵计算方法,增加对分类贡献大的样本的权值,并通过与聚类结合,实现无监督学习. 实验结果表明了本文算法的有效性.关键词 特征选择; 加权信息熵; 聚类中图分类号 TP 391 文献标识码 A doi: 10.3969/j. issn. 1001 -4748.2016.04.0041 引 言很多实际应用中,比如人脸识别、信号处理、文本分类等,数据的维数往往很高,且数据经:胁幌喙睾腿哂嗟奶卣,这些特征增加了机器学习或数据挖掘过程的计算复杂性. 为解决所谓的“维数灾难”问题[1] ,提高计算性能,一般要对数据进行降维处理. 特征选择作为一种数据预处理方式,其目的是从特征域中选择一个最小的子集来代表原始特征,并能保持较高的区分特性 [2] . 进行特征选择之前,选择某个度量来衡量特征显得尤为重要. 信息论之父 Shannon 在论文“A Mathematical Theory of Communication”[3] 中指出,任何信息都存在冗余,冗余大小与信息中每个符号的出现概率或者说不确定性有关. 在信息论中,熵被用来度量随机变量的信息含量. 如果将熵的概念应用到特征选择中,将有利于寻找到含有最多信息的特征.作为朴素集合论的延伸,Pawlak 于 1982 年提出了粗糙集理论[4] . 粗糙集理论已经被证明,可以作为特征选择的有效工具. 不同于基于转换的方法,如主成分分析(PCA)[5] ,基于粗糙集的特征选择方法可以保留信息的原始语义,方便用户理解模型结果.根据搜索策略,特征选择算法可以分为完全搜索算法、随机搜索算法和启发式搜索算法. 完全搜索算法是计算每一种可能的特征子集,寻找最优的;随机搜索算法是在预定的时间或次数内随机地选择特征子集,从而找到一个次优的;启发式搜索算法是根据某种选择方向找到一个次优的特征子集. 目前为止,很多基于粗糙集理论的特征选择算法被提出来 [6 -11] ,其中大多数是启发式的,因为启发式的算法可以避免指数级的计算复杂度和较高的时间复杂度. 传统的基于信息熵的特征选择算法是一种启发式的搜索算法.根据是否使用数据的标记信息,特征选择算法分为监督的特征选择算法和无监督的特征选择算法. 监督的特征选择算法需要使用标记信息来进行学习,无监督的特征选择算法则不需要标记信息. 传统的基于信息熵的特征选择是一种监督的算法,需要使用样本的标记信息. 在实际应用中,样本的标记信息往往很难得到,一个数据集通常只有小部分标记数据和大量的未标记数据. 所谓的“小标记样本问题”[12] 对监督式的学习算法来说是一个巨大的挑战. 因此提出非监督的学习算法是非常必要和有实际意义的 [13] .为解决基于粗糙集理论的特征选择算法中存在的一些问题,本文提出了一种基于密度聚类和样本加权信息熵的特征选择算法(DCWIE). 在 DCWIE 中,首先通过聚类对数据进行分簇,然后使用一种加权的信息熵模型计算每个属性的信息熵,按信息熵的大小排序,选择重要的特征作为特征选择的结果.为验证 DCWIE 算法的有效性,我们在一些应用领域上进行了实验,实验结果验证了该算法的有效性.2 信息熵特征选择算法2. 1 符号标记 给定一个样本集 X ∈ R n×d ,其中 n 和 d 分别是样本个数和特征维数,我们用 x 1 ,x 2 ,. . . ,x n0 2

188宝金博页面版:关注我们

  • 新浪微博

关注188宝金博页面版公众号

188宝金博页面版
阅读
APP
阅读
返回
顶部
188宝金博页面版官网登录在线平台入口(2026已更新)—江苏协昌电子科技股份有限公司