精选优质文档-倾情为你奉上聚类分析原理及步骤将未知数据按相似程度分类到不同的类或簇的过程1 传统的统计聚类分析方法包括系统聚类法、分解法、加入法、动态聚类法、有序样品聚类、有重叠聚类和模糊聚类等。采用k-均值、k-中心点等算法的聚类分析工具已被加入到许多著名的统计分析软件包中,如SPSS、SAS等。典型应用1 动植物分类和对基因进行分类2 在网上进行文档归类来修复信息3 帮助电子商务的用户了解自己的客户,向客户提供更合适 的服务主要步骤1 数据预处理选择数量,类型和特征的标度(依据特征选择和抽取)特征选择选择重要的特征,特征抽取把输入的特征转化为一个新的显著特征,它们经常被用来获取一个合适的特征集来为避免“维数灾”进行聚类)和将孤立点移出数据(孤立点是不依附于一般数据行为或模型的数据)2 为衡量数据点间的相似度定义一个距离函数既然相类似性是定义一个类的基础,那么不同数据之间在同一个特征空间相似度的衡量对于聚类步骤是很重要的,由于特征类型和特征标度的多样性,距离度量必须谨慎,它经常依赖于应用,例如