大数据的是与不是

2020-03-29 11:58 电商

大数据的是与不是

中国IDC 圈11月18道:在时下的流行语中,很难找出一个比大数据

更吸引眼球的术语了。1980年,阿尔文?托夫勒在《第三次浪潮》中预言了信息时代的到来会带来数据爆发,约翰?梅西在1998年的美国高等计算机系统协会大会上首次提出大数据(big data)一词。什么是大数据?这一概念目前尚未形成统一的定义。几种代表性的观点如下:麦肯锡认为大数据是指无法在一定时间内用传统数据库软件工具对其内容进行抓取、管理和处理的数据集合。

维基百科认为大数据是指无法在一定时间内用常规软件工具对其内容进行抓取、管理和处理的数据集;全球最具权威的 IT 研究与顾问咨询公司高德纳公司认为大数据是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

大数据时代已经来临,它将在众多领域掀起变革的巨浪,这是勿庸置疑的事实,在以云计算为代表的技术创新大幕的衬托下,这些原本很难收集和使用的数据开始容易被利用起来了,通过各行各业的不断创新,大数据会逐步为人类创造更多的价值,而对于电企业来说,大数据的应用同样会促进企业的跨越发展。

大数据的本质是事物的时域、空域记录,并非事物的描述数据

对于大数据的特点,IT界通常用Volume(大量)、Velocity(高速)、Variety(多样)、Value (价值)这4 个 V来概括。Volume,指数据体量巨大,从TB级别跃升到PB乃至EB级别;Variety ,指数据类型繁多。除了传统的结构化数据,大量非结构化、半结构化数据如络日志、音频、视频、图片等;Value ,指价值密度低,但大数据分析的价值高。价值密度的高低与数据总量的大小成反比,以视频为例,一部一小时的视频,在连续不间断监控过程中,可能有用的数据仅仅只有一两秒;Velocity,指变化速度快。大数据不仅量大,而且变化快,大数据的应用依赖于对数据的快速处理。但在笔者看来,对大数据作4V特点的概括是现象而非本质总结。

其实人类文明就是大数据的记录与应用积累,当今社会进入了信息时代,信息化的本质是用 IT 技术和方法描述世界,描述事物的内在本质、过程规律和业务规则,信息化的应用过程就是在描述好事物的软件系统中实现人工和 /或机器记录,大数据的本质是事物的时域、空域记录,并非事物的描述数据,大数据成为热门是因为信息化、互联、终端的普及和应用让我们进入了一个机器自动记录的时代,爆炸性增长的记录数据使传统的人工、单机 /单节点的机器处理能力无法完成记录的分析、挖掘,由此催生了云计算和大数据概念并推动人工智能的工程应用,机器学习等人工智能技术就是机器处理大数据及大数据应用高级模式。

大数据应用的本质是推导规律、预知未来,并非简单的统计分析

在信息化时代以前,人类就有典型的大数据应用,如视觉美学总结的黄金分割(0.618 ),社会学中的在特定时空范围内存在的二八理论。大数据应用的本质是推导规律、预知未来,并非简单的统计分析。在信息化时代,大数据极大依赖信息化及其应用,开展大数据分析也必须应用信息化方法与手段,符合信息化业务驱动、目标导向等原则,没有目标的大数据平台建设或挂大数据羊头

不利于信息化建设和大数据应用。

而互联大数据与企业大数据是有区别的,互联本质是跨区域的信息化络基础设施,其大量的内容服务和居于互联社交软件并不存在描述事物的过程即没有对象模型,人们应用互联留下了应用记录(大量的非结构化数据),分析这些大数据记录的前提是重新构建记录的对象,对记录标识特征。企业信息化一般经过业务标准化和业务流程梳理过程,所以企业的大数据是存在对象描述,但企业应用的困难是我们建设的系统在对象描述上不统一、对象上的记录不完整。

所以互联大数据与企业大数据应用尽管原理与方法一致,但分析工作的重点是有区别的。互联公司在开展大数据分析的工具、技术方法不完全适用于企业,更不能把互联大数据的平台建设当做企业大数据应用工作的全部。

区别好对象模型数据与记录数据是大数据分析的基础,尽管描述事物对象的数据也可以达到 PB 级,如人类的基因图谱、地球大气层流动模型、电的络结构模型等,这些数据不是大数据,在这些对象模型上构建软件并记录的业务变化是大数据。所以在大数据应用方面存在两类数据的预处理,一类是模型数据预处理,另一类是记录数据预处理。模型层面的预处理本质是信息化建设方案的科学性、合理性。记录的完整性很大程度上也是取决于信息化方案,同时也取决于信息系统的应用过程。一旦软件上线,再作数据治理来解决模型之间的不一致性或对记录的二次模型化加工是一种方法论上的误导,正确的方法应该是依据企业架构和行业解决方案完善信息化架构,实现企业信息化架构规范和引导下的信息系统建设和应用,在企业层面统筹企业模型、统筹系统结构和功能界面、统一业务系统应用规范。企业的数据治理必须在建设方案中完成,系统建成系统后的数据治理是无效的,当然在系统运行过程中数据库的技术数据治理是必须的。

大数据应用在电领域大有可为

在电企业中,电量数据是一组典型的大数据

大数据的是与不是一岁半小孩便秘怎么办
孩子消化不好怎么办
宝宝消化不良怎么办
冠心病心绞痛发生的原因
安徽癫痫病医院哪家好
藤黄健骨丸治跟骨刺吗