亿信华辰

连续3年稳坐商务智能应用榜首

与此同时,亿信华辰在数据治理领域荣登五强

首页行业资讯数据分析

企业如何去做数据挖掘呢?

时间:2020-06-03来源:CSDN浏览数:26

20世纪90年代晚期发展的跨行业数据挖掘标准流程(CRISP-DM), 这是对我们怎么去做数据挖掘的有效指导

第一, 是商业理解, 在我看来, 这个商业理解就是要把业务问题转换成数据挖掘问题, 目前数据挖掘的理论概念中, 一般都包括分类, 聚类,回归, 关联规则这几类, 这需要对这几类方法有一定的理解, 才能有效地转换,

第二. 数据理解, 数据描述了我们的业务, 在这一步, 我们必须找准对应关系, 所面临的业务问题, 有哪些数据可以用, 我们做的是定量分析, 没有数据显然是得不到模型的, 知道哪里数据和业务关系紧密, 也能让我们的分析事半功倍, 

第三.数据准备, 实际上数据挖掘的大部分工作都在这一步, 往往到了这一步就发现理想很美好, 但现实很骨感, 数据质量令人堪忧, 缺失值, 异常值接踵而来, 这是数据的错误, 还有为了适应算法, 需要将数据去量纲化, 类型转换, 去相关性, 降维等等操作, 这一步将消耗分析人员大量精力

第四, 建模, 这一步需要对算法理解透彻, 要了解数据特征和算法特点, 才能选择最优算法, 以及最优参数, 很多算法的使用是有假设条件的, 必须仔细掌握, 得到的模型才会合理, 另外,还要考虑业务需要, 如果模型必须能解释, 那就要选择生成式模型算法

第五, 评价, 就是模型评估了, 各种评估指标的侧重点是不一样的, 要以最能反应业务的指标为准, 另外,评估数据的选择也很关键, 要尽可能的模拟实际生产环境, 才能评估模型的性能。

以上就是得到模型流程了, 业务理解和数据理解做的好, 就能快速选好方法, 和关键字段,这是能加速建模的, 数据质量是能否得到模型的关键, 缺失值, 异常值虽然能删除,填充, 但是信息的缺失是找不回来的, 就可能导致得不到模型, 可能会倒逼选择其他方法分析, 建模就要看对算法的理解了。

亿信华辰推出的数据挖掘产品亿信豌豆DM,让用户可以通过半自动化或者自动化地分析业务数据,做出归纳性的推理,从中挖掘出潜在的模式,帮助决策者调整市场策略,减少风险,做出正确的决策。

数据挖掘

快乐分享
© 2020 ESENSOFT 北京亿信华辰软件有限责任公司| 版权所有:京ICP备07017321号 京公网安备11010802016281号|免责声明

联系
电话

您好,商务咨询请联系

咨询热线:400-0011-866转0

手机咨询:137-0121-6790

社区
交流

产品技术问题交流

bbs.esensoft.com

9分钟快速处理问题