查看原文
其他

大数据小白的一些浅见

2016-12-02 欧小刚 中国软件网


近期关注大数据比较多,也接触了一些大数据领域的专业人士,收获颇丰。听了诸多专家的观点,对南大通用杜国旺总和华云数据集团的首席技术官郑军博士观点深有感触。在此,基于二位的观点,谈谈我对大数据发展的一些看法。

解构大数据

要谈论大数据,如果学究一点,首先要弄清楚的一个问题就是什么是大数据,怎样来解构大数据这个概念。对于此,杜总的分析还是比较清楚的。

南大通用 杜国旺

在杜总看来,大数据分为三个层面:

第一, 画像数据,包含人物静态画像、事件动态画像和群类画像。人物静态画像是以人或物为基本线索进行数据关联(如:万科),事件动态画像是以事件主题为线索的数据关联(如:雷阳事件),Hadoop技术为实现以上两个需求提供了良好的技术支撑。群类画像是基于二级标引的多维属性画像,数据源以前两类为基础,将典型特征属性进行标引,然后以某个特征属性为线索进行关联,图数据库为该需求提供较好的技术支撑(如地质测绘、套牌车发现)。在我看来,杜总实际指的是数据的三种类型,这三类数据具有某种层度的递进关系,后一类比前一类更抽象更有价值,尤其是群类画像数据。实际上,我们所指的大数据更多的是指群类画像数据,是对很多个体某一特征的抽象概括数据,这样的数据才更有价值。

第二, 数据的统计分析,基于人物或事件的典型特征统计分析或动态查询,主要是基于统计概念的(如金融精准营销),数据源一般为典型的结构化数据,分析方法也较为成熟,mpp数据库为该需求提供快捷方便的技术支撑。

第三, 数据挖掘,这是目前大数据应用最难的,也是最有价值的,就是分析数据关联关系,主要是基于逻辑概念的,如(气象预报、风险预警、趋势分析、 机器人、watson等等),大部分人认为业务建模是一个非常复杂的事情,需要丰富的行业经验。这也正是大数据的应有之意。要从大量数据中挖掘有价值得信息,这与传统的数据统计分析有很大的不同,是深入数据的价值实体的,从海量数据中发现规律。

一枚硬币的三面

华云数据集团的郑军博士认为机器学习对于大数据的发展具有特殊的意义,我深表赞同。按照杜总对大数据的解构分析,数据挖掘才是大数据的本质,而要进行数据挖掘,机器学习方面技术的发展就必不可少了。毕竟要进行海量数据的复杂计算,靠人工来进行传统的统计分析是不现实的。

华云数据集团首席技术官  郑军

对于此,我有一个公式:云计算+大数据+机器学习=智能互联网 

其实云计算、大数据、机器学习这三个概念并不是孤立的,而是相辅相成,缺一不可的。要进行大量数据的处理,并且要将这种数据处理能力像水电一样作为基础设施提供给社会,那就必然要向全社会输出计算能力。目前来看,云计算技术承担了为社会提供计算能力的任务。另外,要将打通各个信息孤岛,共享局部甚至是全社会的数据,必然需要一个基于云架构的信息系统,云计算也承担了打通社会数据的使命。

在拥有强大的计算能力之后,只有通过对海量数据的处理,通过数据挖掘发现其中的价值,才算是发挥了云计算的功用。所以云计算和大数据是一枚硬币的两面,相辅相成。云计算和大数据的紧密关系,已经在业界得到普遍认知,但是要将这项事业推向深入,机器学习技术的发展就必不可少。因为人脑虽然具有很强的创造力,但是对大量信息的存储和处理能力却很缺乏,面对大量结构化和非结构化的数据,单靠人工来进行统计分析,是没效率甚至是不可能的。为计算系统赋予一定的智能,发挥其强大的存储和计算能力,是大数据发展的必然之路。

大数据应用的市场特点与趋势

上面从概念上谈了大数据的理论,但如果要将大数据技术进行实际应用,应该怎么做,又会遇到什么困难呢?对于这个问题,华云数据集团的郑军博士给予了我一些启发。郑博士认为,我们的信息化进程可分为三个阶段:IT化阶段、数字化阶段、数据化阶段。目前阻碍我国大数据产业发展的一个重要障碍就是信息化进程的落后。用郑博士的话说,要进行大数据应用,首先必须得有大量数据,而目前我国的很多企业尤其是小型企业,还处在IT化阶段,几乎没有数据积累。如果“小数据”都没有,谈何大数据。阻碍大数据产业发展的另一障碍就是信息孤岛的大量存在,要想大数据获得发展,首先必须进行全社会数据的打通。

那么,我国的大数据应用情况到底怎么样了,是处于什么阶段呢?带着这样的问题,中国软件网进行了市场调研,并对调研结果进行分析,得出了一些有意思的结论,在此也跟大家分享一下:

1. 大数据主要是从公司的日常运营中产生,其次是从外部引入。

2.产生和存储的大数据类型主要有交易数据、生产数据,其次为移动数据、机器和传感器数据,可以看到企业产生和存储的主要数据都与其业务相关。产生的数据略多于存储的数据,说明还有部分产生的数据没能获得存储。 

3. 从数据处理的全生命周期来看,目前采用的大数据技术方案主要集中于数据采集、分布式存储、分布式计算等靠前的环节。值得注意的是,在大数据分析处理环节,较多的企业也采用了相应的技术方案。 

4.目前已经有和需求较多的大数据应用主要集中新业务拓展、提升客户体验、优化客户市场细分、精细化管理、市场和用户行为预测等几个方面。大数据应用的需求普遍高于已经有的大数据应用,说明市场需求还没有得到满足。但在精细化生产方面,已经有的大数据应用已经超过需求。

5.在大数据应用过程中的难点方面,主要集中在数据安全、数据存储压力、数据类型多样化、数据资源不丰富等几个方面。

6. 在大数据应用部署方面,已经在使用、计划1年内部署、计划2年内部署的企业相当,各占30%左右。

7. 企业在大数据应用方面,最希望获得技术支持、其次是数据业务发展规划支持,以及业务需求管理、产品/服务开发方面的支持。

以上是通过走访行业专家和我们自己的一些研究,对大数据产业发展的一些发现和看法。一方面为我国大数据领域的快速发展而兴奋,另一方面也深感挑战的艰巨。前路漫漫,我国大数据的发展还得靠大家的共同努力。但我始终坚信,道路是曲折的,前途是异常光明的。

附录

华云数据

华云数据是国内领先的综合性云计算服务提供商,以全线覆盖的云服务产品组合、领先的云化支撑运营能力和创新的云CDN等优秀技术致力于成为中国最大的独立云计算服务提供商和一站式云化合作平台。华云数据在国内拥有超过15个城市20个数据中心上万台物理服务器集群,网络覆盖中国电信、中国联通以及华云数据自有BGP网络,实现了从边缘到核心网络的全覆盖。华云数据不仅为用户提供IAAS、PAAS、云协同SAAS、云CDN等多类型服务,同时还提供私有云、电子商务云、金融云、游戏云、IDC转云等安全、方便、易用、节能、可靠、高效的解决方案。

华云数据的两款优秀产品推荐:

DataUltra——面向企业用户的一款基于开源大数据生态系统的大数据应用产品,为用户提供集群、作业、数据分析等一站式大数据处理分析服务,使用户能专注于大数据业务流程优化上,并节约用户的硬件投入成本与平台维护成本。

InsightUltra——面向企业用户的一款基于大数据生态系统的数据挖掘平台,为用户提供专业的大数据级别的数据挖掘和分析服务,使用户能无需专业的数据挖掘技术,即可获得丰富的数据挖掘功能支持,并节约用户的开发成本与平台维护成本。

南大通用

南大通用数据技术有限公司(以下简称南大通用)是专注于数据库领域,国内领先的新型数据库产品和解决方案供应商,为数据分析、数据挖掘、商业智能、海量数据管理。南大通用已经形成了在大规模、高性能、分布式、高安全的数据存储、管理和应用方面的技术储备,同时对于数据整合、应用系统集成、PKI安全等方面具有丰富的应用开发经验。南大通用将以数据管理为核心竞争力,依据自主研发和引进先进技术相结合的方针,不断研发科技含量高、附加值较大、市场急需的具有自主知识产权的软件产品。

本文作者:欧小刚

联系电话:15340125575

联系邮箱:oxg@soft6.com

本文由中国软件网(www.soft6.com)原创发布,未经许可,禁止转载。

点击下方“阅读原文”立即获取

“2016中国HR应用市场研究报告”

您可能也对以下帖子感兴趣

文章有问题?点此查看未经处理的缓存