线上期刊服务咨询,发表咨询:400-808-1701 订阅咨询:400-808-1721

一种新的微博短文本特征词选择算法

黄贤英 陈红阳 刘英涛 熊李媛 计算机工程与科学 2015年第09期

摘要:针对微博短文本有效特征较稀疏且难以提取,从而影响微博文本表示、分类与聚类准确性的问题,提出一种基于统计与语义信息相结合的微博短文本特征词选择算法。该算法基于词性组合匹配规则,根据词项的TF-IDF、词性与词长因子构造综合评估函数,结合词项与文本内容的语义相关度,对微博短文本进行特征词选择,以使挑选出来的特征词能准确表示微博短文本内容主题。将新的特征词选择算法与朴素贝叶斯分类算法相结合,对微博分类语料集进行实验,结果表明,相比其它的传统算法,新算法使得微博短文本分类准确率更高,表明该算法选取出来的特征词能够更准确地表示微博短文本内容主题。

关键词:微博短文本特征词选择统计与语义信息词性组合朴素贝叶斯分类算法

单位:重庆理工大学计算机科学与工程学院 重庆400054

注:因版权方要求,不能公开全文,如需全文,请咨询杂志社

计算机工程与科学

北大期刊

¥624.00

关注 46人评论|5人关注