大数据基本架构
樊月龙
大数据数量庞大,格式多样化。大量数据由家庭、制造工厂和办公场所的各种设备、互联网事务交易、社交网络的活动、自动化传感器、移动设备以及科研仪器等生成。它的爆炸式增长已超出了传统IT基础架构的处理能力,给企业和社会带来严峻的数据管理问题。因此必须开发新的数据架构,围绕“数据收集、数据管理、数据分析、知识形成、智慧行动”的全过程,开发使用这些数据,释放出更多数据的隐藏价值。
http://s12/mw690/933e5f35tx6BsCNb64zab&690
大数据基本架构应包括如图所示内容:
http://s6/mw690/933e5f35tx6CbcJhWNT85&690
大数据基本架构参考如下:
http://s13/mw690/933e5f35tx6BsCTt5lG9c&690
1)数据的获得
大数据产生的根本原因在于感知式系统的广泛使用。随着技术的发展,人们已经有能力制造极其微小的带有处理功能的传感器,并开始将这些设备广泛的布置于社会的各个角落,通过这些设备来对整个社会的运转进行监控。这些设备会源源不断的产生新数据,这种数据的产生方式是自动的。因此在数据收集方面,要对来自网络包括物联网、社交网络和机构信息系统的数据附上时空标志,去伪存真,尽可能收集异源甚至是异构的数据,必要时还可与历史数据对照,多角度验证数据的全面性和可信性。
http://s4/mw690/933e5f35tx6BsCWq9iz33&690
2、数据的汇集和存储:
数据只有不断流动和充分共享,才有生命力。应在各专用数据库建设的基础上,通过数据集成,实现各级各类信息系统的数据交换和数据共享。 数据存储要达到低成本、低能耗、高可靠性目标,通常要用到冗余配置、分布化和云计算技术,在存储时要按照一定规则对数据进行分类,通过过滤和去重,减少存储量,同时加入便于日后检索的标签。
http://s10/mw690/933e5f35tx6BsD5EZoRa9&690
3、数据的管理:
大数据管理的技术也层出不穷。在众多技术中,有6种数据管理技术普遍被关注,即分布式存储与计算、内存数据库技术、列式数据库技术、云数据库、非关系型的数据库、移动数据库技术。其中分布式存储与计算受关注度最高。下图是一个图书数据管理系统:
http://s1/mw690/933e5f35tx6BsDbWLjqf0&690
4、数据的分析
数据分析处理:有些行业的数据涉及上百个参数,其复杂性不仅体现在数据样本本身,更体现在多源异构、多实体和多空间之间的交互动态性,难以用传统的方法描述与度量,处理的复杂度很大,需要将高维图像等多媒体数据降维后度量与处理,利用上下文关联进行语义分析,从大量动态而且可能是模棱两可的数据中综合信息,并导出可理解的内容。大数据的处理类型很多,主要的处理模式可以分为流处理和批处理两种。批处理是先存储后处理,而流处理则是直接处理数据。挖掘的任务主要是关联分析、聚类分析、分类、预测、时序模式和偏差分析等。
http://s5/mw690/933e5f35tx6BsDhiMPq54&690
5、大数据的价值:决策支持系统
大数据的神奇之处就是通过对过去和现在的数据进行分析,它能够精确预测未来;通过对组织内部的和外部的数据整合,它能够洞察事物之间的相关关系;通过对海量数据的挖掘,它能够代替人脑,承担起企业和社会管理的职责。
http://s7/mw690/933e5f35tx6BsDmhtAib6&690
6、数据的使用:
大数据有三层内涵:一是数据量巨大、来源多样和类型多样的数据集;二是新型的数据处理和分析技术;三是运用数据分析形成价值。大数据对科学研究、经济建设、社会发展和文化生活等各个领域正在产生革命性的影响。大数据应用的关键,也是其必要条件,就在于"IT"与"经营"的融合,当然,这里的经营的内涵可以非常广泛,小至一个零售门店的经营,大至一个城市的经营。
http://s5/mw690/933e5f35tx6BsDqRd6k54&690
上海市科学技术委员会12日发布了《上海推进大数据研究与发展三年行动计划》(2013—2015年),同时成立“上海大数据产业技术创新战略联盟”。重点选取金融证券、互联网、数字生活、公共设施、制造和电力等具有迫切需求的行业,开展大数据行业应用研发,探索“数据、平台、应用、终端”四位一体的新型商业模式,促进产业发展。重点选取医疗卫生、食品安全、终身教育、智慧交通、公共安全、科技服务等具有大数据基础的领域,探索交互共享、一体化的服务模式,建设大数据公共服务平台,促进大数据技术成果惠及民众。
加载中,请稍候......