温馨提示:由于个人手机设置不同,如果发现不能下载,请复制以下地址【https://www.wenke99.com/d-9958300.html】到电脑端继续下载(重复下载不扣费)。
1: 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。 2: 试题试卷类文档,如果标题没有明确说明有答案则都视为没有答案,请知晓。 3: 文件的所有权益归上传用户所有。 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。 5. 本站仅提供交流平台,并不能对任何下载内容负责。 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
本文(第三讲(数据预处理)ppt课件.ppt)为本站会员(晟***)主动上传,文客久久仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对上载内容本身不做任何修改或编辑。 若此文所含内容侵犯了您的版权或隐私,请立即通知文客久久(发送邮件至hr@wenke99.com或直接QQ联系客服),我们立即给予删除!
数据挖掘第三讲 数据预处理主要内容 n 为什么要预处理数据? n 数据清理 n 数据集成和变换 n 数据归约为什么要预处理数据? n 现实世界的数据是“肮脏的” q 不完整的:有些感兴趣的属性缺少属性值,或仅包 含聚集数据 q 含噪声的:包含错误或者“ 孤立点” q 不一致的:数据源不同,其在编码或命名上有差异 n 没有高质量的数据,就没有高质量的挖掘结果 q 高质量的决策必须依赖高质量的数据 q 数据仓库需要对高质量的数据进行一致地集成数据质量的多维度量 n 一个广为认可的多维度量观点: q 精确度 q 完整度 q 一致性 q 合乎时机 q 可信度 q 附加价值(已经物化的数据,方便我们挖掘研究) q 可访问性 n 跟数据本身的含义相关的 q 内在的、上下文相关的、数据的表达形式数据预处理的主要任务 n 数据清理 q 填写空缺的值,平滑噪声数据,识别、删除孤立点,解决不 一致性 n 数据集成 q 集成多个数据库、数据立方体或文件 n 数据变换 q 规范化和聚集 n 数据归约 q 通过一些技术(概念分层上卷等)得到数据集的压缩表示, 它小得多,但可以得到相同或相近的结果 n 数据离散化
Copyright © 2018-2021 Wenke99.com All rights reserved
工信部备案号:浙ICP备20026746号-2
公安局备案号:浙公网安备33038302330469号
本站为C2C交文档易平台,即用户上传的文档直接卖给下载用户,本站只是网络服务中间平台,所有原创文档下载所得归上传人所有,若您发现上传作品侵犯了您的权利,请立刻联系网站客服并提供证据,平台将在3个工作日内予以改正。