精选优质文档-倾情为你奉上DNA序列分类 摘要 本问题是一个“有人管理分类问题” 首先分别列举出20个学习样本序列中1字符串、2字符串、3字符串出现的频率,构成含41个变量的基本特征集,接着用主成分分析法从中提取出4个特征然后用Fisher线性判别法进行分类,得出了所求20个人工制造序列及182个自然序列的分类结果如下:1) 20个人工序列:22, 23,25,27,29,34,35,36,37为A类,其余为B类2) 182个自然序列:1,4,8,10,27,29,32,41,43,48,54,63,70,72,75,76,81,86,90,92,102,110,116,119,126,131,144,150,157,159,160,161,162,163,164,165,166,169,170,182为B类,其余为A类最后通过检验证明所用的分类数学模型效率较高一、问 题 重 述人类基因组计划中DNA全序列草图是由4个字符A,T,C,G按一定顺序排成的长约30亿的字符序列,其中没有“断句”也没有标点符号虽然人类对它知之甚少,但