详细地理解阅读你所不了解的“大数据”
日期:2023-12-24 13:39:55   来源:常见问题

  进入2012年,大数据(big data)一词慢慢的变多地被提及,人们用它来描述和定义信息爆炸时代产生的海量数据,并命名与之相关的技术发展与创新。它已经上过《》《华尔街日报》的专栏封面,进入美国白宫官网的新闻,现身在国内一些互联网主题的讲座沙龙中,甚至被嗅觉灵敏的证券公司等写进了投资推荐报告。

  进入2012年,大数据(big data)一词慢慢的变多地被提及,人们用它来描述和定义信息爆炸时代产生的海量数据,并命名与之相关的技术发展与创新。它已经上过《》《华尔街日报》的专栏封面,进入美国白宫官网的新闻,现身在国内一些互联网主题的讲座沙龙中,甚至被嗅觉灵敏的证券公司等写进了投资推荐报告。

  数 据正在迅速膨胀并变大,它决定着企业的未来发展,虽然现在企业可能并没意识到数据爆炸性增长带来问题的隐患,但是跟着时间的推移,人们将慢慢的变多的意识 到数据对企业的重要性。大数据时代对人类的数据驾驭能力提出了新的挑战,也为人们获得更为深刻、全面的洞察能力提供了前所未有的空间与潜力。

  最 早提出大数据时代到来的是全球知名咨询公司麦肯锡,麦肯锡称:“数据,已经渗透到当今每一个行业和业务职能领域,成为重要的生产因素。人类对于海量数据的 挖掘和运用,预示着新一波生产率增长和消费的人盈余浪潮的到来。”“大数据”在物理学、生物学、环境生态学等领域以及军事、金融、通讯等行业存在已有时日, 却因为近年来互联网和信息行业的发展而引起人们关注。

  大数据在互联网行业指的是这样一种现象:网络公司在日常运营中生成、累积的用户网络行为数据。这一些数据的规模是如此庞大,以至于不能用G或T来衡量,大数据的起始计量单位至少是P(1000个T)、E(100万个T)或Z(10亿个T)。

  信息技术领域原先已经有“海量数据”、“大规模数据”等概念,但这些概念只着眼于数据规模本身,未能充分反映数据爆发背景下的数据处理与应用需求,而“大数据”这一新概念不仅指规模庞大的数据对象,也包含对这一些数据对象的处理和应用活动,是数据对象、技术与应用三者的统一。

  1、大数据(bigdata),或称巨量资料,指的是所涉及的资料量规模巨大到无法透过目前主流软件工具,在合理时间内达到撷取、管理、处理、并整理成为帮企业经营决策更积极目的的资讯。大数据对象既可能是实际的、有限的数据集合,如某个政府部门或企业掌握的数据库,也可能是虚拟的、无限的数据集合,如微博、微信、社交网络上的全部信息。

  大数据是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。从数据的类别上看,“大数据”指的是没办法使用传统流程或工具处理或分析的信息。它定义了那些超出正常处理范围和大小、迫使用户采用非传统处理方法的数据集。

  亚马逊网络服务(AWS)、 大数据科学家JohnRauser提到一个简单的定义:大数据就是任何超过了一台计算机解决能力的庞大数据量。研发小组对大数据的定义:“大数据是最大的 宣传技术、是最时髦的技术,当这种现象出现时,定义就变得很混乱。”Kelly说:“大数据是可能不包含所有的 信息,但我觉得大部分是正确的。对大数据的一部分认知在于,它是如此之大,分析它需要多个工作负载,这是AWS的定义。

  2、大数据技术,是指从各种各样类型的大数据中,快速获得有价值信息的技术的能力,包括数据采集、存储、管理、分析挖掘、可视化等技术及其集成。适用于大数据的技术,包括大规模并行处理(MPP)数据库,数据挖掘电网,分布式文件系统,分布式数据库,云计算平台,互联网,和可扩展的存储系统。

  3、大数据应用,是 指对特定的大数据集合,集成应用大数据技术,获得有价值信息的行为。对于不相同的领域、不同企业的不同业务,甚至同一领域不相同企业的相同业务来说,由于其业务 需求、数据集合和分析挖掘目标存在一定的差异,所运用的大数据技术和大数据信息系统也可能有着相当大的不同。惟有坚持“对象、技术、应用”三位一体同步发展,才 能充分实现大数据的价值。

  当你的技术达到极限时,也就是数据的极限”。大数据不是关于如何定义,最重要的是怎么样去使用。最大的挑战在于哪些技术能更好的使用数据及大数据的应用情况如何。这与传统的数据库相比,开源的大数据分析工具的如Hadoop的崛起,这些非结构化的数据服务的价值在哪里。

  3)社交数据(Socialdata):包括用户行为记录,反馈数据等。如Twitter,Facebook这样的社会化媒体平台。

  业界通常用4个V(即Volume、Variety、Value、Velocity)来概括大数据的特征。具体来说,大数据具有4个基本特征:

  数 据体量(volumes)大,指代大型数据集,一般在10TB规模左右,但在实际应用中,很多企业用户把多个数据集放在一起,已形成了PB级的数据量; 百度资料表明,其新首页导航每天需要出示的数据超过1.5PB(1PB=1024TB),这一些数据如果打印出来将超过5千亿张A4纸。有资料证实,到目前 为止,人类生产的所有印刷材料的数据量仅为200PB。

  数据类别(variety)大,数据来自多种数据源,数据种类和格式日渐丰富,已冲破了以前所限定的结构化 数据范畴,囊括了半结构化和非结构化数据。现在的数据类型不仅是文本形式,更多的是图片、视频、音频、地理位置信息等多类型的数据,个性化数据占绝对多数。

  在数据量非常庞大的情况下,也能做到数据的实时处理。数据处理遵循“1秒定律”,可从很多类型的数据中快速获得高价值的信息。

  数据真实性(Veracity)高,随着社交数据、企业内容、交易与应用数据等新数据源的兴趣,传统数据源的局限被打破,企业愈发需要有效的信息之力以确保其真实性及安全性。以视频为例,一小时的视频,在不间断的监控过程中,可能有用的数据仅仅只有一两秒。

  移动互联网、物联网、社交网络、数字家庭、电子商务等是新一代信息技术的应用形态,这些应用不断产生大数据。云计算为这些海量、多样化的大数据提供存储和运算平台。通过对不同来源数据的管理、处理、分析与优化,将结果反馈到上述应用中,将创造出巨大的经济和社会价值。

  大数据具有催生社会变革的能量。但释放这种能量,需要严谨的数据治理、富有洞见的数据分析和激发管理创新的环境(Ramayya Krishnan,卡内基·梅隆大学海因兹学院院长)。

  面向大数据市场的新技术、新产品、新服务、新业态会不断涌现。在硬件与集成设备领域,大数据将对芯片、存储产业产生重要影响,还将催生一体化数据存储处理服务器、内存计算等市场。在软件与服务领域,大数据将引发数据快速处理分析、数据挖掘技术和软件产品的发展。

  各 行各业的决策正在从“业务驱动” 转变“数据驱动”。对大数据的分析可以使零售商实时掌握市场动态并迅速做出应对;可以为商家制定更精准有效的经营销售的策略提供决策支持;能够在一定程度上帮助企业为消费 者提供更加及时和个性化的服务;在医疗领域,可提高诊断准确性和药物有效性;在公共事业领域,大数据也开始发挥促进经济发展、维护社会稳定等方面的重要作 用。

  例如,抽样调查是社会科学的基本研究方法。在大数据时代,可通过实时监测、跟踪研究对象在网络上产生的海量行为数据,进行挖掘分析,揭示出规律性的东西,提出研究结论和对策。

  “大数据”可以对顾客群体细分,然后对每个群体量体裁衣般的采取独特的行动。瞄准特定的顾客群体来进行营销和服务是商家一直以来的追求。云存储的海量数据和“大数据”的分析技术使得对消费的人的实时和极端的细分有了成本效率极高的可能。

  运用“大数据”模拟实境,发掘新的需求和提高投入的回报率。现在慢慢的变多的产品中都装有传感器,汽车和智能手机的普及使得可收集数据呈现爆炸性增长。Blog、Twitter、Facebook和微博等社交网络也在产生着海量的数据。

  云 计算和“大数据”分析技术使得商家能在成本效率较高的情况下,实时地把这一些数据连同交易行为的数据来进行储存和分析。交易过程、产品使用和人类行为都可以 数据化。“大数据”技术能把这一些数据整合起来进行数据挖掘,从而在某些情况下通过模型模拟来判断不同变量(比如不一样的地区不同促销方案)的情况下何种方案 投入回报最高。

  提高“大数据”成果在各有关部门的分享程度,提高整个管理链条和产业链条的投入回报率。“大数据”能力强的部门能够最终靠云计算、互联网和内部搜索引擎把”大数据”成果和“大数据”能力比较薄弱的部门分享,帮他们利用“大数据”创造商业价值。

  企 业和个人有着海量信息存储的需求,只有将数据妥善存储,才有机会进一步挖掘其潜在价值。具体而言,这块业务模式又可以细分为针对个人文件存储和针对企业用 户两大类。主要是通过易于使用的API,用户都能够方便地将各种数据对象放在云端,然后再像使用水、电一样按用量收费。目前已有多个公司推出相应服务,如亚 马逊、网易、诺基亚等。运营商也推出了相应的服务,如中国移动的彩云业务。

  客 户管理应用的目的是按照每个客户的属性(包括自然属性和行为属性),从不同角度深层次分析客户、了解客户,以此增加新的客户、提升客户的忠诚度、降低客户流失 率、提升客户消费等。对中小客户来说,专门的CRM显然大而贵。不少中小商家将飞信作为初级CRM来使用。比如把老客户加到飞信群里,在群朋友圈里发布新 产品预告、特价销售通知,完成售前售后服务等。

  在 运营商内部,按照每个用户喜好推荐各类业务或应用是常见的,比如应用商店软件推荐、IPTV视频节目推荐等,而通过关联算法、文本摘要抽取、情感分析等智能分 析算法后,可以将之延伸到商用化服务,利用数据挖掘技术帮助客户进行精准营销,今后盈利可以来自于客户增值部分的分成。

  以日常的“垃圾短信”为例,信息并不都是“垃圾”,因为收到的人并不是特别需要而被视为垃圾。通过用户行为数据来进行分析后,可以给需要的人发送需要的信息,这样“垃圾短信”就成了有价值的信息。在日本的麦当劳,用户在手机上下载优惠券,再去餐厅用运营商DoCoMo的手机钱包优惠支付。运营商与麦当劳搜集相关消费信息,例如经常买什么汉堡,去哪个店消费,消费频次多少,然后精准推送优惠券给用户。

  数据搜索是一个并不新鲜的应用,随着“大数据”时代的到来,实时性、全范围搜索的需求也就慢慢的变强烈。我们应该能搜索各种社交网络、用户行为等数据。其商业应用价值是将实时的数据处理与分析和广告联系起来,即实时广告业务和应用内移动广告的社交服务。

  运营商掌握的用户网上行为信息,使得所获取的数据“具备更全面维度”,更具商业经济价值。典型应用如中国移动的“盘古搜索”。

  比如对中国零售业净利润增长的贡献,降造业产品研究开发、组装成本等。预计2013年全球大数据直接和间接拉动信息技术支出将达1200亿美元。

  大数据在公共服务领域的应用,可有效推动相关工作开展,提高有关部门的决策水平、服务效率和社会管理上的水准,产生巨大社会价值。欧洲多个城市通过一系列分析实时采集的交通流量数据,指导驾车出行者选择最佳路径,从而改善城市交通状况。

  对大数据应用一定要保持清醒认识,既不能迷信其分析结果,也不能因为其不完全准确而否定其重要作用。

  1) 由于种种原因,所分析处理的数据对象中不可避免地会包括各种错误数据、无用数据,加之作为大数据技术核心的数据分析、人工智能等技术尚未完全成熟,所以对 计算机完成的大数据分析处理的结果,无法要求其完全准确。例如,谷歌通过一系列分析亿万用户搜索内容能够比专业机构更快地预测流感暴发,但由于微博上无用信息的 干扰,这种预测也曾多次出现不准确的情况。

  2)必须清楚定位的是,大数据作用与价值的重点在于能够引导和启发大数据应用者的创新思维,辅助决策。简单而言,若是处理一个问题,通常人能够想到一种方法,而大数据可提供十种参考方法,哪怕其中只有三种可行,也将处理问题的思路拓展了三倍。

  所以,客观认识和发挥大数据的作用,不夸大、不缩小,是准确认知和应用大数据的前提。

  不管大数据的核心价值是不是预测,但是基于大数据形成决策的模式已经为不少的公司能够带来了盈利和声誉。

  1)手握大数据,但是没有利用好;很典型的是金融机构,电信行业,政府机构等。

  2)没有数据,但是知道怎么帮助有数据的人利用它;很典型的是IT咨询和服务企业,比如,埃森哲,IBM,Oracle等。

  2)还未有被大数据触及过的业务领域。这些是还未被挖掘的油井,金矿,是所谓的蓝海。

  大 数据是信息技术与专业方面技术、信息技术产业与各行业领域紧密融合的典型领域,有着旺盛的应用需求、广阔的应用前景。为把握这一新兴领域带来的新机遇,需要不 断跟踪研究大数据,不断的提高对大数据的认知和理解,坚持技术创新与应用创新的协同共进,加快经济社会各领域的大数据开发与利用,推动国家、行业、企业对于 数据的应用需求和应用水平进入新的阶段。返回搜狐,查看更加多