《大型技术架构》读书笔记

本贴最后更新于 2938 天前,其中的信息可能已经时过境迁
前段时间读了《大型技术架构》一书,现把书中的要点记录下来。
  1. 网站架构模式:分层(单一职责,MVC分层,控制层-服务层-数据层),分割(不同功能与服务分割),分布式(服务调用需要通过网络,带来了网络问题;分布式数据一致性问题),集群,缓存,异步,冗余(冷备份,热备份),自动化,安全。
  2. 常用的分布式方案:分布式应用与服务;分布式静态资源(动静分离JS,CSS,图片等,减轻应用服务器的负载压力);分布式数据与存储(读写分离;分库分表;缓存优化;传统数据库分布式部署;使用NoSQL);分布式计算。
  3. 缓存:CDN(内容分发,部署在离用户最近的网络服务商),反向代理(部署在网站的数据中心),本地缓存(缓存在本机内存中,但是不适合大量的数据),分布式缓存(分布式缓存集群)。热点数据缓存,注意缓存的时间,避免出现数据脏读,影响数据一致性。
  4. 异步:单一服务器可以通过多线程共享内存队列的方式实现;分布式系统中可以通过分布式消息队列实现。典型的模型就是生产者-消费者模式,两者之间不存在直接调用,只是保持数据结构不变。作用:提高网站可用性;加快网站响应速度;消除并发访问高峰。
  5. 性能问题,网站响应速度慢,优化措施:通过浏览器缓存,页面压缩等;使用CDN,动静分离,部署反向代理服务器,缓存热点文件;使用本地缓存与分布式缓存;使用消息队列,异步处理请求;代码层面使用多线程,内存管理等进行优化;数据库方面使用索引,缓存,优化SQL,读写分离等。
  6. 可用性:网站高可用的主要手段就是冗余,通过负载均衡服务器统一一个集群对外提供服务,有效的负载均衡策略;数据服务器进行实时备份,宕机时进行数据转移并恢复。
  7. 网站可扩展性的主要手段是事件驱动架构和分布式服务。事件驱动通常将请求构造成消息发布到消息队列之中,消息处理者通过消息队列中获取消息进行处理。分布式服务是将业务与基础服务分离开来。
  8. 性能优化策略:首先要进行性能数据的搜集,然后针对性能报告进行性能分析,检查请求处理的各个环节的日志信息,分析是哪个环节响应时间较长,检查监控数据,分析影响性能的是硬件设施(内存,磁盘,CPU,网络)还是代码问题还是架构设计不合理,亦或是系统资源不足等。找到问题的原因后再针对不同的问题进行相应的优化。
  9. 浏览器访问优化:减少http请求(合并CSS,JS文件,图片等),http协议是无状态的应用层协议,意味着每次http请求都需要建立通信链路,进行数据传输。使用浏览器缓存(设置http的头字段)。启用压缩(对html,css,js文件进行GZIP压缩)
  10. 网站优化第一定律:优先考虑使用缓存优化性能。
  11. 缓存的基本原理:缓存指的是将数据存储在相对较高访问速度的存储介质中,减少数据访问的时间。缓存的本质是一个内存Hash表,数据缓存以一对Key,Value的形式存储在内存Hash表中。Hash表数据读写的时间复杂度为O(1)。缓存中主要用来存放读写比较高,很少变化的数据,应用程序先读写缓存,缓存中没有或者数据失效再去数据库中查询,并将查询到的数据写入缓存。缓存要考虑数据一致性问题与脏读。可以设置策略是数据更新后马上更新缓存。缓存雪崩问题通过分布式缓存解决。
  12. 分布式缓存:缓存部署在多个服务器组成的集群上。两种缓存架构方式:JBoss Cache为代表的需要更新同步的分布式缓存;以Memcached为代表的不互相通信的分布式缓存。
  13. JBoss Cache的分布式缓存在集群中的所有服务器上都保存相同的缓存数据,当某台服务器缓存更新时,会通知集群中所有的机器进行缓存更新或清除缓存。一般会将JBoss Cache与应用程序部署在同一服务器上。
  14. Memcached采用的是集中式的缓存管理,缓存与应用分离部署,缓存系统部署在专门的集群上,应用程序通过一致性hash等路由算法选择缓存服务器远程访问缓存数据,缓存服务器之间不通信。这样缓存集群可以很简单的实现扩容,具备良好的可伸缩性。采用的是TCP协议(UDP也支持)通信,序列化协议是通过基于文本的自定义协议。服务端和客户端,采用memcached协议交互。
  15. ①负载均衡+session复制,将session同步至每个应用服务器,保证服务的状态。②session绑定,利用负载均衡的源地址hash算法实现将来源于同一IP的请求始终分发到同一台应用服务器上。③利用浏览器的cookie记录下session以及sessionID,将session以及sessionID发送给负载均衡器,负载均衡服务器根据sessionID将请求转发至相应的应用服务器。④设置专门的session服务器统一管理session,应用程序每次读写session都通过session服务器。
  16. 负载均衡算法:轮询:请求依次分发到每台应用服务器上;加权轮询:根据应用服务器的性能进行加权重新分配;随机;最少连接:记录每个应用服务器正在处理的请求连接数,将新的请求分配到连接数最少的服务器上;源地址散列。
  17. 网络IO的实现:BIO;NIO;AIO。
  18. BIO采用阻塞的方式实现,也就是说一个Socket套接字需要使用一个线程来处理。支持并发的连接,需要更多的线程来完成这个工作。
  19. NIO基于事件驱动思想,采用的是Reactor模式。可以在一个线程中处理多个套接字Socket相关的工作。Reactor会管理所有的handler,并把出现的事件交给相应的handler去处理。
  20. AIO就是异步IO。采用Proactor模式,AIO与NIO的区别:AIO在读写操作时,只需要调用相应的read/write方法,并且需要传入CompletionHandler;在完成动作后会调用CompletionHandler。而NIO的通知是发生在动作之前,是在可写可读的时候,selector发现这些事件后调用handler处理。
  21. 控制器的变化:使用硬件负载均衡——》使用软件负载均衡(LVS)(透明代理,请求发送发和处理方都不需要知道对方,但是存在不足:增加网络的开销,比如流量和延时;代理出现问题则所有请求都会受到影响)——》采用名称服务直连方式请求调用(名称服务器是通过跟请求处理的机器交互来获取这些机器的地址)——》采用规则服务器控制路由的请求直连调用(规则服务器本身并不和请求处理的机器进行交互,只负责把规则提供给请求发起的机器)——》master+worker的方式(存在一个master来管理worker)
  22. 运算器的变化:DNS调度——》DNS+负载均衡调度(DNS返回的永远都是负载均衡设备的地址)
  23. 存储器的变化:单机的Key-Value服务——》使用代理服务器的多机Key-Value服务——》使用名称服务的Key-Value服务——》使用规则服务器的Key-Value服务——》通过Master的Key-Value服务
  24. 分布式系统的难点:①缺乏全局时钟;②面对故障独立性;③处理单点故障;④事务的挑战
  25. 数据库读写分离:两个问题:数据复制问题(使用数据库本身提供的数据复制机制,但还是存在复制延时的数据不一致性问题);应用对于数据源的选择问题(写操作要走主库,事务中的读操作也要走主库)
  26. 搜索引擎技术解决大型网站站内搜索时的某些场景下的读的问题,提供了更好的查询效率,站内搜索结构和使用读库非常相似,只是多了自己建立数据索引的步骤。
  27. 缓存:数据缓存(全数据缓存(数据库的数据发生变化后会把数据写入到缓存中,保证数据不会读取失效);热数据缓存(应用访问缓存,如果数据不存在则去数据库里读取并把数据加入到缓存中));页面缓存(ESI规范)
  28. 缓存的一个关键指标缓存命中率,如果缓存命中率比较低的话就意味着有不少请求要回到数据库中查询。还要考虑缓存服务器的扩容与缩容(一致性hash)以及缓存数据更新(定时失效,数据变更时失效,数据变更时更新)。
  29. 数据库拆分:专库专用,数据垂直拆分(不同业务数据拆分到不同的数据库中);数据的水平拆分(把同一个表的数据拆分到不同的数据库中)。
  30. 服务化:把应用分为三层,处于最上端的是Web系统,用于完成不同的业务功能;处于中间的是一些服务中心,不同的服务中心提供不同的业务服务,处于下层的则是业务的数据库同时引入了远程调用,共享代码不再散落在各个应用中而是放到了各个服务中心上。数据交互工作由业务服务中心完成。
  31. 远程过程调用和对象访问中间件(主要解决分布式环境下应用互相访问的问题);消息中间件(解决应用之间的消息传递,解耦以及异步问题);数据访问中间件(主要解决应用访问数据库的共性问题)
  32. 静态代理与动态代理?静态代理为每一个被代理的对象构造对应的代理类。动态代理是动态地生成具体委托类的代理实现对象,通过Proxy.newProxyInstance来创建代理方法可以为不同的委托类都创建代理类。方法调用使用invoke。
  33. 服务化使得原来的一些本地调用变为了远程调用。远程调用:获取可用服务地址列表->确定要调用服务的目标机器->建立连接->请求序列化->发送请求->接受结果->解析结果
  • 架构

    我们平时所说的“架构”主要是指软件架构,这是有关软件整体结构与组件的抽象描述,用于指导软件系统各个方面的设计。另外还有“业务架构”、“网络架构”、“硬件架构”等细分领域。

    141 引用 • 441 回帖
  • Java

    Java 是一种可以撰写跨平台应用软件的面向对象的程序设计语言,是由 Sun Microsystems 公司于 1995 年 5 月推出的。Java 技术具有卓越的通用性、高效性、平台移植性和安全性。

    3169 引用 • 8208 回帖
  • 分布式
    78 引用 • 149 回帖 • 4 关注

相关帖子

欢迎来到这里!

我们正在构建一个小众社区,大家在这里相互信任,以平等 • 自由 • 奔放的价值观进行分享交流。最终,希望大家能够找到与自己志同道合的伙伴,共同成长。

注册 关于
请输入回帖内容 ...
请输入回帖内容 ...

推荐标签 标签

  • Q&A

    提问之前请先看《提问的智慧》,好的问题比好的答案更有价值。

    7015 引用 • 31704 回帖 • 220 关注
  • Netty

    Netty 是一个基于 NIO 的客户端-服务器编程框架,使用 Netty 可以让你快速、简单地开发出一个可维护、高性能的网络应用,例如实现了某种协议的客户、服务端应用。

    49 引用 • 33 回帖 • 20 关注
  • B3log

    B3log 是一个开源组织,名字来源于“Bulletin Board Blog”缩写,目标是将独立博客与论坛结合,形成一种新的网络社区体验,详细请看 B3log 构思。目前 B3log 已经开源了多款产品:SymSoloVditor思源笔记

    1083 引用 • 3461 回帖 • 257 关注
  • 负能量

    上帝为你关上了一扇门,然后就去睡觉了....努力不一定能成功,但不努力一定很轻松 (° ー °〃)

    88 引用 • 1234 回帖 • 442 关注
  • GraphQL

    GraphQL 是一个用于 API 的查询语言,是一个使用基于类型系统来执行查询的服务端运行时(类型系统由你的数据定义)。GraphQL 并没有和任何特定数据库或者存储引擎绑定,而是依靠你现有的代码和数据支撑。

    4 引用 • 3 回帖 • 16 关注
  • PWL

    组织简介

    用爱发电 (Programming With Love) 是一个以开源精神为核心的民间开源爱好者技术组织,“用爱发电”象征开源与贡献精神,加入组织,代表你将遵守组织的“个人开源爱好者”的各项条款。申请加入:用爱发电组织邀请帖
    用爱发电组织官网:https://programmingwithlove.stackoverflow.wiki/

    用爱发电组织的核心驱动力:

    • 遵守开源守则,体现开源&贡献精神:以分享为目的,拒绝非法牟利。
    • 自我保护:使用适当的 License 保护自己的原创作品。
    • 尊重他人:不以各种理由、各种漏洞进行未经允许的抄袭、散播、洩露;以礼相待,尊重所有对社区做出贡献的开发者;通过他人的分享习得知识,要留下足迹,表示感谢。
    • 热爱编程、热爱学习:加入组织,热爱编程是首当其要的。我们欢迎热爱讨论、分享、提问的朋友,也同样欢迎默默成就的朋友。
    • 倾听:正确并恳切对待、处理问题与建议,及时修复开源项目的 Bug ,及时与反馈者沟通。不抬杠、不无视、不辱骂。
    • 平视:不诋毁、轻视、嘲讽其他开发者,主动提出建议、施以帮助,以和谐为本。只要他人肯努力,你也可能会被昔日小看的人所超越,所以请保持谦虚。
    • 乐观且活跃:你的努力决定了你的高度。不要放弃,多年后回头俯瞰,才会发现自己已经成就往日所仰望的水平。积极地将项目开源,帮助他人学习、改进,自己也会获得相应的提升、成就与成就感。
    1 引用 • 487 回帖
  • 机器学习

    机器学习(Machine Learning)是一门多领域交叉学科,涉及概率论、统计学、逼近论、凸分析、算法复杂度理论等多门学科。专门研究计算机怎样模拟或实现人类的学习行为,以获取新的知识或技能,重新组织已有的知识结构使之不断改善自身的性能。

    76 引用 • 37 回帖 • 1 关注
  • Kafka

    Kafka 是一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模的网站中的所有动作流数据。 这种动作(网页浏览,搜索和其他用户的行动)是现代系统中许多功能的基础。 这些数据通常是由于吞吐量的要求而通过处理日志和日志聚合来解决。

    35 引用 • 35 回帖
  • ZeroNet

    ZeroNet 是一个基于比特币加密技术和 BT 网络技术的去中心化的、开放开源的网络和交流系统。

    1 引用 • 21 回帖 • 609 关注
  • SQLServer

    SQL Server 是由 [微软] 开发和推广的关系数据库管理系统(DBMS),它最初是由 微软、Sybase 和 Ashton-Tate 三家公司共同开发的,并于 1988 年推出了第一个 OS/2 版本。

    19 引用 • 31 回帖 • 1 关注
  • Solidity

    Solidity 是一种智能合约高级语言,运行在 [以太坊] 虚拟机(EVM)之上。它的语法接近于 JavaScript,是一种面向对象的语言。

    3 引用 • 18 回帖 • 353 关注
  • Bug

    Bug 本意是指臭虫、缺陷、损坏、犯贫、窃听器、小虫等。现在人们把在程序中一些缺陷或问题统称为 bug(漏洞)。

    71 引用 • 1737 回帖 • 1 关注
  • CSDN

    CSDN (Chinese Software Developer Network) 创立于 1999 年,是中国的 IT 社区和服务平台,为中国的软件开发者和 IT 从业者提供知识传播、职业发展、软件开发等全生命周期服务,满足他们在职业发展中学习及共享知识和信息、建立职业发展社交圈、通过软件开发实现技术商业化等刚性需求。

    14 引用 • 155 回帖
  • GitLab

    GitLab 是利用 Ruby 一个开源的版本管理系统,实现一个自托管的 Git 项目仓库,可通过 Web 界面操作公开或私有项目。

    46 引用 • 72 回帖
  • 房星科技

    房星网,我们不和没有钱的程序员谈理想,我们要让程序员又有理想又有钱。我们有雄厚的房地产行业线下资源,遍布昆明全城的 100 家门店、四千地产经纪人是我们坚实的后盾。

    6 引用 • 141 回帖 • 566 关注
  • RIP

    愿逝者安息!

    8 引用 • 92 回帖 • 322 关注
  • OpenStack

    OpenStack 是一个云操作系统,通过数据中心可控制大型的计算、存储、网络等资源池。所有的管理通过前端界面管理员就可以完成,同样也可以通过 Web 接口让最终用户部署资源。

    10 引用 • 5 关注
  • NetBeans

    NetBeans 是一个始于 1997 年的 Xelfi 计划,本身是捷克布拉格查理大学的数学及物理学院的学生计划。此计划延伸而成立了一家公司进而发展这个商用版本的 NetBeans IDE,直到 1999 年 Sun 买下此公司。Sun 于次年(2000 年)六月将 NetBeans IDE 开源,直到现在 NetBeans 的社群依然持续增长。

    78 引用 • 102 回帖 • 646 关注
  • Electron

    Electron 基于 Chromium 和 Node.js,让你可以使用 HTML、CSS 和 JavaScript 构建应用。它是一个由 GitHub 及众多贡献者组成的活跃社区共同维护的开源项目,兼容 Mac、Windows 和 Linux,它构建的应用可在这三个操作系统上面运行。

    15 引用 • 136 回帖 • 6 关注
  • 音乐

    你听到信仰的声音了么?

    60 引用 • 510 回帖 • 1 关注
  • TensorFlow

    TensorFlow 是一个采用数据流图(data flow graphs),用于数值计算的开源软件库。节点(Nodes)在图中表示数学操作,图中的线(edges)则表示在节点间相互联系的多维数据数组,即张量(tensor)。

    20 引用 • 19 回帖
  • flomo

    flomo 是新一代 「卡片笔记」 ,专注在碎片化时代,促进你的记录,帮你积累更多知识资产。

    4 引用 • 91 回帖
  • abitmean

    有点意思就行了

    38 关注
  • 书籍

    宋真宗赵恒曾经说过:“书中自有黄金屋,书中自有颜如玉。”

    76 引用 • 390 回帖
  • 电影

    这是一个不能说的秘密。

    120 引用 • 598 回帖
  • SMTP

    SMTP(Simple Mail Transfer Protocol)即简单邮件传输协议,它是一组用于由源地址到目的地址传送邮件的规则,由它来控制信件的中转方式。SMTP 协议属于 TCP/IP 协议簇,它帮助每台计算机在发送或中转信件时找到下一个目的地。

    4 引用 • 18 回帖 • 608 关注
  • Oracle

    Oracle(甲骨文)公司,全称甲骨文股份有限公司(甲骨文软件系统有限公司),是全球最大的企业级软件公司,总部位于美国加利福尼亚州的红木滩。1989 年正式进入中国市场。2013 年,甲骨文已超越 IBM,成为继 Microsoft 后全球第二大软件公司。

    103 引用 • 126 回帖 • 443 关注