预览加载中,请您耐心等待几秒...
1/10
2/10
3/10
4/10
5/10
6/10
7/10
8/10
9/10
10/10

亲,该文档总共32页,到这已经超出免费预览范围,如果喜欢就直接下载吧~

如果您无法下载资料,请参考说明:

1、部分资料下载需要金币,请确保您的账户上有足够的金币

2、已购买过的文档,再次下载不重复扣费

3、资料包下载后请先用软件解压,在使用对应软件打开

基于文本的聚类算法研究 PAGEII 摘要 聚类作为一种知识发现的重要方法,它广泛地与中文信息处理技术相结合,应用于网络信息处理中以满足用户快捷地从互联网获得自己需要的信息资源。文本聚类是聚类问题在文本挖掘中的有效应用,它根据文本数据的不同特征,按照文本间的相似性,将其分为不同的文本簇。其目的是要使同一类别的文本间的相似度尽可能大,而不同类别的文本间的相似度尽可能的小。整个聚类过程无需指导,事先对数据结构未知,是一种典型的无监督分类。 本文首先介绍了文本聚类的相关的技术,包括文本聚类的过程,文本表示模型,相似度计算及常见聚类算法。本文主要研究的聚类主要方法是k-均值和SOM算法,介绍了两种算法的基本思想和实现步骤,并分析两种算法的聚类效果。同时介绍了两种算法的改进算法。 关键词:文本聚类聚类方法K-MEANSOM Abstract Clusteringasanimportantknowledgediscoverymethod,whichextensivelywithChineseinformationprocessingtechnology,usedinnetworkinformationprocessingtomeettheuserstoquicklyaccessfromtheInternet,theinformationresourcestheyneed.Textclusteringisaclusteringproblemintheeffectiveapplicationoftextmining,whichaccordingtothedifferentcharacteristicsoftextdata,accordingtothesimilaritybetweenthetext,thetextwillbedividedintodifferentclusters.Theaimistomakethesameclassaslargeaspossiblethesimilaritybetweenthetext,anddifferenttypesoftextassmallaspossiblethesimilaritybetween.Theclusteringprocesswithoutguidance,priortothedatastructureisunknown,isatypicalunsupervisedclassification.Thispaperstudiestheeffectofinfluencingfactorsthattextclustering,textrepresentationofthemodelsuchastheBooleanmodel,vectorspacemodel,probabilisticretrievalmodelandlanguagemodel.Alsostudiedtheanalysisofsuchtextclusteringalgorithm:hierarchicalclustering,agglomerativehierarchicalclusteringalgorithm,hierarchicalclusteringalgorithmtosplitandsoon.Alsostudiedthetextclusteringalgorithmanalysisandmethodsofimprovement. Keywords:Textclusteringclusteringmethodk-meansom 基于文本的聚类算法研究 目录 TOC\o"1-3"\h\z\uHYPERLINK\l"_Toc295303994"摘要 PAGEREF_Toc295303994\hIV HYPERLINK\l"_Toc295303995"Abstract PAGEREF_Toc295303995\hV HYPERLINK\l"_Toc295303996"目录 PAGEREF_Toc295303996\hVI HYPERLINK\l"_Toc295303997"第一章绪论 PAGEREF_Toc295303997\h1 HYPERLINK\l"_Toc295303998"1.1课题研究的背景 PAGEREF_Toc295303998\h1 HYPERLINK\l"_Toc295303999"1.2课题研究的意义 PAGEREF_Toc295303999\h2 HYPERLINK\l"_Toc295304000"第二章文本聚类效果影响因素 PAGEREF_Toc295304000\h3 HYPERLINK\