大数据学习 PPT,讲述大数据基础的概念,Hadoop 生态,常用技术。(PPT+ 讲义)

本贴最后更新于 1897 天前,其中的信息可能已经时移世异

本文为 PPT 的讲义,请配合 PPT 使用。
因为是对公司同事的大数据科普课程,因此基础思想讲的比较多。技术详情,PPT 中写的比较清楚。
PPT 在此云盘连接中。
链接:大数据学习 PPT 百度云盘提取码:ll08
因为是讲义,所以行文比较口语化,大家见谅。

起始语:

“大家好,今天很荣幸和大家一起来了解一下大数据,让咱们对现在很火热的大数据有一个大概的了解。我们今天会讲到大数据的来源,大数据的概念,大数据的相关核心技术与组件,以及大数据的应用等。”

  • 首选我们看大数据的来源。
    说起大数据,那么就要先说说数据。数据的本质是什么呢?

  • 4:念
    在十几年前,可能大家数据还没有现在这么看重,有些时候对一些数据,比如系统日志,操作日志,还有一些机器的参数记录,一些视频记录,都认为是杂乱的,没有太大价值的“副产物”,没有认识到数据的真正价值,很多时候都是一删了之。但是现在,数据已经被放到了非常重要的战略地位。数据现在被认为是最重要的资产和资源之一。国家现在也对数据资产很重视。

  • 5:念。
    另一个现实是数据在不断地爆炸性增长。大家自己也能直观的感受到。比如说手机的存储。从几年前的 8 个 G12 个 G,到现在的 64G128G。但是依然很快就不够用了。自己出去玩一次能拍几百多张照片。APP 大小从几 M 到几百 M。更别说我们使用 APP 产生的海量数据了。

  • 6:
    但是这就导致了一个新的问题。
    数据资产的概念被人们接受了。大家都了解到管理数据资产的重要性。
    如何理解呢,曾经,关系型数据库是万能的。我们做任何系统都会去使用关系型数据库。但是现在单纯的关系型数据库,不管是单机还是集群,已经无法满足现有需求了。看 PPT

  • 7:
    现有的数据资产管理的挑战主要来源于哪里。
    看 PPT

那对于新时代的 数据资产,对于现有的大数据管理现状,我们都有哪些新的需求呢?

  • 8:
    首先是看数据的方式要不同,这个看,怎么理解呢。这个看不仅仅是指 前端看报表,看页面,主要指的是看待数据的方式,我们以前看数据,会直观的把数据结构化,关系化。认为有序的,符合范式的数据才是好数据,才是可以利用的数据,我们去找数据,利用数据,只看到了这部分数据,却没有看到冰山下更多的数据。现在我们要转变看数据的观念,看到隐藏在海面下的冰山。这部分数据是什么呢?PPT

  • 9:
    其次,我们需要更高性价比的计算与存储方式。物理上,我们现在单机存储,是很昂贵的。而且是越大,越昂贵。计算能力,如果是单纯依靠堆服务器,那成本更加不可想象。数据库层面,超过一定数据量后,单机数据库就无法使用了,数据库集群的成本和系统复杂度又过于高昂,现在暴炸性的数据和计算,我们需要更加廉价,更高效的处理方式。

  • 10:
    再然后,以前的数据管理策略都是基于结构化数据的,在遇到不同的数据结构式,显然已经无法处理了。再有,现有的处理逻辑和系统架构,业无法适应大数据时代的需求。想要扩充,只能 scale-up(扩展),scale-out(分体扩展。) 不易;scale Up(纵向扩展) 主要是利用现有的存储系统,通过不断增加存储容量来满足数据增长的需求。Scale-out 横向扩展架构的升级通常是以节点为单位,每个节点往往将包含容量、处理能力和 I / O 带宽。一个节点被添加到存储系统,系统中的三种资源将同时升级。
    PPT。

  • 11:
    再有,从以下四个方面 PPT。这四方面都提出了巨大的考验,这些已经超出了现有企业 It 能独自解决的能量范围了。我们需要一种新的,适应爆炸性的数据增长,能解决我们之前提出的问题的解决方案。

  • 12:
    再从政策层面说,现在的中央政府对大数据很支持,PPT。
    郑州已经被设立为八个国家大数据综合试验区之一。
    郑州是地级市中唯一设立大数据管理局的。其他都为政务与大数据管理局。
    从这些国家领导人的话和各项落实的政策里,可以看到,大数据时代已经到来。我们也需要新的技术来解决我们遇到的数据问题,而这个选择就是大数据。

  • 13:
    我们接下来来了解一下大数据的概念。
    什么是大数据?
    以及大数据技术所带来的的思维模式与之前有什么不同?有什么特点,又能带来怎样的变化。

  • 14:
    首选,什么是数据?
    PPT
    从数据结构上来说,有结构化,半结构化,非结构化。
    从感受上来说,万物皆为数据,我们所能看到的,所能感受到的,甚至无法感受的,都可以说是数据。能看到的,结构化的文档,非结构化的视频,等等。

  • 15:
    那什么是大数据呢?
    这个大作何解释,首选大,是体量上的大。PPT
    1K 就已经是 2 的十次方 bit 了。一个 bit 是 一个 0 或 1。
    1M 是 2 的 20 次方,1G 是 2 的 30 次方,1T 是 2 的 40 次方,1PB 是 2 的 50 次方
    银河系星球数量是 4*10 的 11 次方。

  • 16:
    数据是如此之多,以至于,已经没有办法在可容忍的时间下使用常规软件方法完成存储、管理和处理任务。
    从 PPT 可以看到,
    2010 年产生的新数据就可以抵得上 52000 个美国国会图书馆。那么到如今 2018 年呢。每年的数据增长量都是百分之几十的递增。如今的数据存储量更是暴涨。

  • 17:
    综合以上所述的种种情况,我们来看一下各个机构对大数据的定义是什么?
    PPT

  • 18:
    我们综合这些定义,可以得出一个什么结论呢?我们看 PPT,念定义。
    这个图展示了系统和数据量级,以及数据的复杂性增长。
    ERP 业务是最复杂的,但是数据结构是最清洗,数据量是最小的。
    最后的日志之类的,甚至没有业务逻辑,但是数据是最复杂的,量是最大的。

  • 19:
    定义了大数据,我们来看一下大数据的 4v 特性。
    PPT
    有人呢,把大数据 4V 特性,扩展为了十个字。我们接下来再讲

  • 20:
    首选讲讲体量特性,就是指大数据体量极大。这个大家从之前的 PPT 都能看到。大数据首先要解决的就是数据体量大的问题。

  • 21:
    速度特性,一方面是指数据增长的速度极快,另一方面讲是说数据处理的速度极快

  • 22:
    年 PPT

  • 23:
    价值密度,大数据并不是说数据量多了,数据价值就更高。可能数据量增大后,数据平均价值是下降的。也就是说数据的价值密度比较低。

  • 24:
    以上四个特性是外国人总结的,下面我们讲讲中国人总结的,这是华为的大数据专家傅一航总结的,大数据的十字特性。PPT

  • 25:
    念 PPT

  • 26:
    念 PPT

  • 27:
    念 PPT

  • 28:
    念 PPT
    这十个字,是对大数据 4v 特性的深化。

  • 29:
    大数据时代,大数据技术的到来,不光带来了技术上,数据存储上的革新。同时也带来了新的思维模式来处理数据,主要是从以下三个方面来。PPT

  • 30:
    如何理解呢,我们看 PPT,如何理解更多。?
    以前,我们无法收集尽可能多的数据,只能尽量收集关键数据,也无法存储所有的数据,没有能力去计算所有的数据。所以,我们进行的计算,分析都是基于样本数据的。但是现在不一样了,我们能够获取全部数据,可以用比较廉价的算力和存储来进行数据的收集和分析,我们就可以对,所有的数据进行分析。以 PPT 所示的人口调查的例子来说。

  • 31:
    如何理解更杂?
    我们以前整理数据,获取数据都是追求越精确越好,数据越干净越纯净越好。这一方面是因为我们人类对于真理,对于精准的追求,另一方面,也是迫于现实情况。我们只能从混乱中提取出精准,才能处理。我们有限的资源只能处理精准的数据。但是大数据技术,大数据时代改变了这个形式。根据 4v 特性,大数据的价值密度是很低的。体量是很大的。必然,这些混杂数据质量没有精准数据高。但是,这不是缺陷,而是另一种价值。我们从中可以获取更多的信息,更多的价值。看 ppt

  • 32:
    如何理解更好,也就是因果关系与相关关系呢。
    我们看 PPT
    因果很好理解,从 A 推出 B,从 B 推出 C。那什么是相关呢。我们同属于一个公司,我们是相关的,我是男性,所有男性和我都是相关的。所以,大数据时代,分析问题的逻辑不再是因为 A,所以 B。而是有无数个相关条件,那么得出一个结论。这个结论只是可能性。数据越多,样本越多,相关性越多,这个可能性越高。但是,我们不能说,因为我是男的,所以我就要怎么样怎么样。所以,这是相关,而不是因果。

  • 33:
    好,我们都看了大数据的来源,大数据概念,对大数据的一些特性和一些思维上的改变。那么我们接下来看一下大数据相关的技术。
    我们会看一下,大数据的生态,相关大数据技术的主流厂商,从六个方向分析大数据所用的技术。一些组件。

  • 34:
    首先,我们来看大数据核心相关信息。
    我们要明确,广义上,大数据是一种概念,一种理论。同时,在狭义上,大家也习惯将大数据指为一种技术,也就是以 hadoop 为核心的生态。
    那么我们来看看这个生态系统。PPT

  • 35:
    我们看一下大数据生态的整体架构,我们从五个方面说。
    数据采集,就是获取数据,包括从数据库,日志,摄像头,一些数据流信息,甚至物联网设备,这些都是数据源。
    。。。。。。
    PPT
    可以看到,大数据的整个生态,是从实,到虚,又到实。是一个闭环。对,从用户的角度来说,看起来像是一个黑盒系统,和之前的关系型数据库,传统的处理,好像没有什么不同。但是实际上,我们做的比以前要多的多。

  • 36:
    接下来,我们看一下,现在大数据生态中,比较主流的大数据软件集成商是那些。
    主要有以下三家:PPT
    我们使用的是 Cloudera,点击看一下。

  • 37:
    我们看一下三家主流厂商的系统对比。
    今年,Hortonworks 的 Ambari 系统。 和 Cloudera 合并了。。。
    所以,以后 ambari 和 clouderaManager 可能就是一个了。。

  • 38:
    接下来,我们看一下,我们公司现有的大数据平台的架构。
    我们采用了 Cloudera 公司的方案,使用了 ClouderaManager 平台。
    大体架构如下:
    PPT

  • 39:
    接下来,我们从大数据获取的方向来看一下大数据的组件
    第一个是 sqoop,sqoop 是类似于 ETL 的一个工具组件。
    PPT

  • 40:
    接下来,我们看一下另一个数据获取组件 Flume,水槽。。
    它是由 Cloudra 贡献的。

  • 41:
    接下来,我们来看一个 hadoop 里非常重要的组件 HDFS,谷歌他们用的是 GFS 系统。
    PPT
    可以理解为 hadoop 是一个架子,你往里放什么砖,就会做出什么功能的建筑。

  • 42:
    念 PPT

  • 43:
    念 PPT

  • 44:
    关于无法存储小文件,HDFS 对大文件处理是很优秀的。但是大量小文件会导致运行效率变差。

  • 45:
    文件是被拆开,分别存储在不同的服务器硬盘上的。

  • 46:
    namenode 存的是目录,datanode 存的是文件。

  • 47:
    namenode 负责什么呢?

**中间部分 PPT 都为技术详细情况介绍,可以直接看 PPT

  • 92:
    京东的仓储体系,早几年前就使用了大数据的分析。会分析某个地区,将来可能会购买的物品,将其提前调配到最近的仓库。以达到快速配送的目的。所以京东敢喊次日达。当日达。

  • 93:
    阿里的智慧工厂系统,通过大数据 +AI,曾经给某个光伏长提高了 1% 的生产效率。提高了一个多亿的效益。

  • 大数据

    大数据(big data)是指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

    93 引用 • 113 回帖
  • PPT
    7 引用 • 17 回帖
  • 教程
    143 引用 • 602 回帖 • 8 关注

相关帖子

欢迎来到这里!

我们正在构建一个小众社区,大家在这里相互信任,以平等 • 自由 • 奔放的价值观进行分享交流。最终,希望大家能够找到与自己志同道合的伙伴,共同成长。

注册 关于
请输入回帖内容 ...
sq8852161
前端后端数据库,什么都要做的JAVA码农。( Ĭ ^ Ĭ )

推荐标签 标签

  • 爬虫

    网络爬虫(Spider、Crawler),是一种按照一定的规则,自动地抓取万维网信息的程序。

    106 引用 • 275 回帖
  • CentOS

    CentOS(Community Enterprise Operating System)是 Linux 发行版之一,它是来自于 Red Hat Enterprise Linux 依照开放源代码规定释出的源代码所编译而成。由于出自同样的源代码,因此有些要求高度稳定的服务器以 CentOS 替代商业版的 Red Hat Enterprise Linux 使用。两者的不同在于 CentOS 并不包含封闭源代码软件。

    238 引用 • 224 回帖
  • Q&A

    提问之前请先看《提问的智慧》,好的问题比好的答案更有价值。

    8109 引用 • 36991 回帖 • 161 关注
  • 强迫症

    强迫症(OCD)属于焦虑障碍的一种类型,是一组以强迫思维和强迫行为为主要临床表现的神经精神疾病,其特点为有意识的强迫和反强迫并存,一些毫无意义、甚至违背自己意愿的想法或冲动反反复复侵入患者的日常生活。

    15 引用 • 161 回帖
  • Caddy

    Caddy 是一款默认自动启用 HTTPS 的 HTTP/2 Web 服务器。

    12 引用 • 54 回帖 • 166 关注
  • 以太坊

    以太坊(Ethereum)并不是一个机构,而是一款能够在区块链上实现智能合约、开源的底层系统。以太坊是一个平台和一种编程语言 Solidity,使开发人员能够建立和发布下一代去中心化应用。 以太坊可以用来编程、分散、担保和交易任何事物:投票、域名、金融交易所、众筹、公司管理、合同和知识产权等等。

    34 引用 • 367 回帖
  • Webswing

    Webswing 是一个能将任何 Swing 应用通过纯 HTML5 运行在浏览器中的 Web 服务器,详细介绍请看 将 Java Swing 应用变成 Web 应用

    1 引用 • 15 回帖 • 629 关注
  • 支付宝

    支付宝是全球领先的独立第三方支付平台,致力于为广大用户提供安全快速的电子支付/网上支付/安全支付/手机支付体验,及转账收款/水电煤缴费/信用卡还款/AA 收款等生活服务应用。

    29 引用 • 347 回帖 • 1 关注
  • AngularJS

    AngularJS 诞生于 2009 年,由 Misko Hevery 等人创建,后为 Google 所收购。是一款优秀的前端 JS 框架,已经被用于 Google 的多款产品当中。AngularJS 有着诸多特性,最为核心的是:MVC、模块化、自动化双向数据绑定、语义化标签、依赖注入等。2.0 版本后已经改名为 Angular。

    12 引用 • 50 回帖 • 474 关注
  • 黑曜石

    黑曜石是一款强大的知识库工具,支持本地 Markdown 文件编辑,支持双向链接和关系图。

    A second brain, for you, forever.

    15 引用 • 122 回帖
  • OkHttp

    OkHttp 是一款 HTTP & HTTP/2 客户端库,专为 Android 和 Java 应用打造。

    16 引用 • 6 回帖 • 62 关注
  • B3log

    B3log 是一个开源组织,名字来源于“Bulletin Board Blog”缩写,目标是将独立博客与论坛结合,形成一种新的网络社区体验,详细请看 B3log 构思。目前 B3log 已经开源了多款产品:SymSoloVditor思源笔记

    1063 引用 • 3453 回帖 • 203 关注
  • Git

    Git 是 Linux Torvalds 为了帮助管理 Linux 内核开发而开发的一个开放源码的版本控制软件。

    209 引用 • 358 回帖 • 1 关注
  • Sublime

    Sublime Text 是一款可以用来写代码、写文章的文本编辑器。支持代码高亮、自动完成,还支持通过插件进行扩展。

    10 引用 • 5 回帖
  • V2Ray
    1 引用 • 15 回帖 • 1 关注
  • TGIF

    Thank God It's Friday! 感谢老天,总算到星期五啦!

    287 引用 • 4484 回帖 • 669 关注
  • FFmpeg

    FFmpeg 是一套可以用来记录、转换数字音频、视频,并能将其转化为流的开源计算机程序。

    23 引用 • 32 回帖
  • PWA

    PWA(Progressive Web App)是 Google 在 2015 年提出、2016 年 6 月开始推广的项目。它结合了一系列现代 Web 技术,在网页应用中实现和原生应用相近的用户体验。

    14 引用 • 69 回帖 • 154 关注
  • LaTeX

    LaTeX(音译“拉泰赫”)是一种基于 ΤΕΧ 的排版系统,由美国计算机学家莱斯利·兰伯特(Leslie Lamport)在 20 世纪 80 年代初期开发,利用这种格式,即使使用者没有排版和程序设计的知识也可以充分发挥由 TeX 所提供的强大功能,能在几天,甚至几小时内生成很多具有书籍质量的印刷品。对于生成复杂表格和数学公式,这一点表现得尤为突出。因此它非常适用于生成高印刷质量的科技和数学类文档。

    12 引用 • 54 回帖 • 65 关注
  • 生活

    生活是指人类生存过程中的各项活动的总和,范畴较广,一般指为幸福的意义而存在。生活实际上是对人生的一种诠释。生活包括人类在社会中与自己息息相关的日常活动和心理影射。

    230 引用 • 1454 回帖
  • Mac

    Mac 是苹果公司自 1984 年起以“Macintosh”开始开发的个人消费型计算机,如:iMac、Mac mini、Macbook Air、Macbook Pro、Macbook、Mac Pro 等计算机。

    166 引用 • 595 回帖
  • Ant-Design

    Ant Design 是服务于企业级产品的设计体系,基于确定和自然的设计价值观上的模块化解决方案,让设计者和开发者专注于更好的用户体验。

    17 引用 • 23 回帖 • 1 关注
  • 微软

    微软是一家美国跨国科技公司,也是世界 PC 软件开发的先导,由比尔·盖茨与保罗·艾伦创办于 1975 年,公司总部设立在华盛顿州的雷德蒙德(Redmond,邻近西雅图)。以研发、制造、授权和提供广泛的电脑软件服务业务为主。

    8 引用 • 44 回帖
  • RIP

    愿逝者安息!

    8 引用 • 92 回帖 • 351 关注
  • golang

    Go 语言是 Google 推出的一种全新的编程语言,可以在不损失应用程序性能的情况下降低代码的复杂性。谷歌首席软件工程师罗布派克(Rob Pike)说:我们之所以开发 Go,是因为过去 10 多年间软件开发的难度令人沮丧。Go 是谷歌 2009 发布的第二款编程语言。

    497 引用 • 1387 回帖 • 285 关注
  • Log4j

    Log4j 是 Apache 开源的一款使用广泛的 Java 日志组件。

    20 引用 • 18 回帖 • 31 关注
  • 代码片段

    代码片段分为 CSS 与 JS 两种代码,添加在 [设置 - 外观 - 代码片段] 中,这些代码会在思源笔记加载时自动执行,用于改善笔记的样式或功能。

    用户在该标签下分享代码片段时需在帖子标题前添加 [css] [js] 用于区分代码片段类型。

    69 引用 • 372 回帖 • 1 关注