阿里P9架构师简述从单机至亿级流量大型网站系统架构的演进过程

news/2024/5/13 18:30:05/文章来源:https://blog.csdn.net/qq_37716175/article/details/79683087

阶段一、单机构建网站

网站的初期,我们经常会在单机上跑我们所有的程序和软件。此时我们使用一个容器,如tomcat、jetty、jboos,然后直接使用JSP/servlet技术,或者使用一些开源的框架如maven+spring+struct+hibernate、maven+spring+springmvc+mybatis;最后再选择一个数据库管理系统来存储数据,如mysql、sqlserver、oracle,然后通过JDBC进行数据库的连接和操作。

把以上的所有软件都装载同一台机器上,应用跑起来了,也算是一个小系统了。此时系统结果如下:


阶段二、应用服务器与数据库分离

随着网站的上线,访问量逐步上升,服务器的负载慢慢提高,在服务器还没有超载的时候,我们应该就要做好准备,提升网站的负载能力。假如我们代码层面已难以优化,在不提高单台机器的性能的情况下,增加机器是一个不错的方式,不仅可以有效地提高系统的负载能力,而且性价比高。

增加的机器用来做什么呢?此时我们可以把数据库,web服务器拆分开来,这样不仅提高了单台机器的负载能力,也提高了容灾能力。

应用服务器与数据库分开后的架构如下图所示:


阶段三、应用服务器集群

随着访问量继续增加,单台应用服务器已经无法满足需求了。在假设数据库服务器没有压力的情况下,我们可以把应用服务器从一台变成了两台甚至多台,把用户的请求分散到不同的服务器中,从而提高负载能力。多台应用服务器之间没有直接的交互,他们都是依赖数据库各自对外提供服务。著名的做故障切换的软件有keepalived,keepalived是一个类似于layer3、4、7交换机制的软件,他不是某个具体软件故障切换的专属品,而是可以适用于各种软件的一款产品。keepalived配合上ipvsadm又可以做负载均衡,可谓是神器。

我们以增加了一台应用服务器为例,增加后的系统结构图如下:


系统演变到这里,将会出现下面四个问题:

用户的请求由谁来转发到到具体的应用服务器

有什么转发的算法

应用服务器如何返回用户的请求

用户如果每次访问到的服务器不一样,那么如何维护session的一致性

我们来看看解决问题的方案:

1、第一个问题即是负载均衡的问题,一般有5种解决方案:

1、http重定向。HTTP重定向就是应用层的请求转发。用户的请求其实已经到了HTTP重定向负载均衡服务器,服务器根据算法要求用户重定向,用户收到重定向请求后,再次请求真正的集群

优点:简单。

缺点:性能较差。

2、DNS域名解析负载均衡。DNS域名解析负载均衡就是在用户请求DNS服务器,获取域名对应的IP地址时,DNS服务器直接给出负载均衡后的服务器IP。

优点:交给DNS,不用我们去维护负载均衡服务器。

缺点:当一个应用服务器挂了,不能及时通知DNS,而且DNS负载均衡的控制权在域名服务商那里,网站无法做更多的改善和更强大的管理。

3、反向代理服务器。在用户的请求到达反向代理服务器时(已经到达网站机房),由反向代理服务器根据算法转发到具体的服务器。常用的apache,nginx都可以充当反向代理服务器。

优点:部署简单。

缺点:代理服务器可能成为性能的瓶颈,特别是一次上传大文件。

4、IP层负载均衡。在请求到达负载均衡器后,负载均衡器通过修改请求的目的IP地址,从而实现请求的转发,做到负载均衡。

优点:性能更好。

缺点:负载均衡器的宽带成为瓶颈。

5、数据链路层负载均衡。在请求到达负载均衡器后,负载均衡器通过修改请求的mac地址,从而做到负载均衡,与IP负载均衡不一样的是,当请求访问完服务器之后,直接返回客户。而无需再经过负载均衡器。

2、第二个问题即是集群调度算法问题,常见的调度算法有10种。

1、rr 轮询调度算法。顾名思义,轮询分发请求。

优点:实现简单

缺点:不考虑每台服务器的处理能力

2、wrr 加权调度算法。我们给每个服务器设置权值weight,负载均衡调度器根据权值调度服务器,服务器被调用的次数跟权值成正比。

优点:考虑了服务器处理能力的不同

3、sh 原地址散列:提取用户IP,根据散列函数得出一个key,再根据静态映射表,查处对应的value,即目标服务器IP。过目标机器超负荷,则返回空。

4、dh 目标地址散列:同上,只是现在提取的是目标地址的IP来做哈希。

优点:以上两种算法的都能实现同一个用户访问同一个服务器。

5、lc 最少连接。优先把请求转发给连接数少的服务器。

优点:使得集群中各个服务器的负载更加均匀。

6、wlc 加权最少连接。在lc的基础上,为每台服务器加上权值。算法为:(活动连接数*256+非活动连接数)÷权重 ,计算出来的值小的服务器优先被选择。

优点:可以根据服务器的能力分配请求。

7、sed 最短期望延迟。其实sed跟wlc类似,区别是不考虑非活动连接数。算法为:(活动连接数+1)*256÷权重,同样计算出来的值小的服务器优先被选择。

8、nq 永不排队。改进的sed算法。我们想一下什么情况下才能“永不排队”,那就是服务器的连接数为0的时候,那么假如有服务器连接数为0,均衡器直接把请求转发给它,无需经过sed的计算。

9、LBLC 基于局部性的最少连接。均衡器根据请求的目的IP地址,找出该IP地址最近被使用的服务器,把请求转发之,若该服务器超载,最采用最少连接数算法。

10、LBLCR 带复制的基于局部性的最少连接。均衡器根据请求的目的IP地址,找出该IP地址最近使用的“服务器组”,注意,并不是具体某个服务器,然后采用最少连接数从该组中挑出具体的某台服务器出来,把请求转发之。若该服务器超载,那么根据最少连接数算法,在集群的非本服务器组的服务器中,找出一台服务器出来,加入本服务器组,然后把请求转发之。

3、第三个问题是集群模式问题,一般3种解决方案:

1、NAT:负载均衡器接收用户的请求,转发给具体服务器,服务器处理完请求返回给均衡器,均衡器再重新返回给用户。

2、DR:负载均衡器接收用户的请求,转发给具体服务器,服务器出来玩请求后直接返回给用户。需要系统支持IP Tunneling协议,难以跨平台。

3、TUN:同上,但无需IP Tunneling协议,跨平台性好,大部分系统都可以支持。

4、第四个问题是session问题,一般有4种解决方案:

1、Session Sticky。session sticky就是把同一个用户在某一个会话中的请求,都分配到固定的某一台服务器中,这样我们就不需要解决跨服务器的session问题了,常见的算法有ip_hash法,即上面提到的两种散列算法。

优点:实现简单。

缺点:应用服务器重启则session消失。

2、Session Replication。session replication就是在集群中复制session,使得每个服务器都保存有全部用户的session数据。

优点:减轻负载均衡服务器的压力,不需要要实现ip_hasp算法来转发请求。

缺点:复制时宽带开销大,访问量大的话session占用内存大且浪费。

3、Session数据集中存储:session数据集中存储就是利用数据库来存储session数据,实现了session和应用服务器的解耦。

优点:相比session replication的方案,集群间对于宽带和内存的压力减少了很多。

缺点:需要维护存储session的数据库。

4、Cookie Base:cookie base就是把session存在cookie中,有浏览器来告诉应用服务器我的session是什么,同样实现了session和应用服务器的解耦。

优点:实现简单,基本免维护。

缺点:cookie长度限制,安全性低,宽带消耗。

值得一提的是:

nginx目前支持的负载均衡算法有wrr、sh(支持一致性哈希)、fair(本人觉得可以归结为lc)。但nginx作为均衡器的话,还可以一同作为静态资源服务器。

keepalived+ipvsadm比较强大,目前支持的算法有:rr、wrr、lc、wlc、lblc、sh、dh

keepalived支持集群模式有:NAT、DR、TUN

nginx本身并没有提供session同步的解决方案,而apache则提供了session共享的支持。

推荐一个Java高级技术进阶群:619881427,文章运用到的架构技术都会在群里分享,都能免费下载。有兴趣学习的猿猿可以加一下。

好了,解决了以上的问题之后,系统的结构如下:


阶段四、数据库读写分离化

上面我们总是假设数据库负载正常,但随着访问量的的提高,数据库的负载也在慢慢增大。那么可能有人马上就想到跟应用服务器一样,把数据库一份为二再负载均衡即可。但对于数据库来说,并没有那么简单。假如我们简单的把数据库一分为二,然后对于数据库的请求,分别负载到A机器和B机器,那么显而易见会造成两台数据库数据不统一的问题。那么对于这种情况,我们可以先考虑使用读写分离的方式。

读写分离后的数据库系统结构如下:


这个结构变化后也会带来两个问题:

主从数据库之间数据同步问题

应用对于数据源的选择问题

解决问题方案:

我们可以使用MYSQL自带的master+slave的方式实现主从复制。

采用第三方数据库中间件,例如mycat。mycat是从cobar发展而来的,而cobar是阿里开源的数据库中间件,后来停止开发。mycat是国内比较好的mysql开源数据库分库分表中间件。

阶段五、用搜索引擎缓解读库的压力

数据库做读库的话,常常对模糊查找力不从心,即使做了读写分离,这个问题还未能解决。以我们所举的交易网站为例,发布的商品存储在数据库中,用户最常使用的功能就是查找商品,尤其是根据商品的标题来查找对应的商品。对于这种需求,一般我们都是通过like功能来实现的,但是这种方式的代价非常大。此时我们可以使用搜索引擎的倒排索引来完成。

搜索引擎具有以下优点:

它能够大大提高查询速度。

引入搜索引擎后也会带来以下的开销:

带来大量的维护工作,我们需要自己实现索引的构建过程,设计全量/增加的构建方式来应对非实时与实时的查询需求。

需要维护搜索引擎集群

搜索引擎并不能替代数据库,他解决了某些场景下的“读”的问题,是否引入搜索引擎,需要综合考虑整个系统的需求。引入搜索引擎后的系统结构如下:


阶段六、用缓存缓解读库的压力

1、后台应用层和数据库层的缓存

随着访问量的增加,逐渐出现了许多用户访问同一部分内容的情况,对于这些比较热门的内容,没必要每次都从数据库读取。我们可以使用缓存技术,例如可以使用google的开源缓存技术guava或者使用memcacahe作为应用层的缓存,也可以使用redis作为数据库层的缓存。

另外,在某些场景下,关系型数据库并不是很适合,例如我想做一个“每日输入密码错误次数限制”的功能,思路大概是在用户登录时,如果登录错误,则记录下该用户的IP和错误次数,那么这个数据要放在哪里呢?假如放在内存中,那么显然会占用太大的内容;假如放在关系型数据库中,那么既要建立数据库表,还要简历对应的java bean,还要写SQL等等。而分析一下我们要存储的数据,无非就是类似{ip:errorNumber}这样的key:value数据。对于这种数据,我们可以用NOSQL数据库来代替传统的关系型数据库。

2、页面缓存

除了数据缓存,还有页面缓存。比如使用HTML5的localstroage或者cookie。

优点:

减轻数据库的压力

大幅度提高访问速度

缺点:

需要维护缓存服务器

提高了编码的复杂性

值得一提的是:

缓存集群的调度算法不同与上面提到的应用服务器和数据库。最好采用“一致性哈希算法”,这样才能提高命中率。这个就不展开讲了,有兴趣的可以查阅相关资料。

加入缓存后的结构:


阶段七、数据库水平拆分与垂直拆分

我们的网站演进到现在,交易、商品、用户的数据都还在同一个数据库中。尽管采取了增加缓存,读写分离的方式,但随着数据库的压力继续增加,数据库的瓶颈越来越突出,此时,我们可以有数据垂直拆分和水平拆分两种选择。

推荐一个Java高级技术进阶群:619881427,文章运用到的架构技术都会在群里分享,都能免费下载。有兴趣学习的猿猿可以加一下。

7.1、数据垂直拆分

垂直拆分的意思是把数据库中不同的业务数据拆分道不同的数据库中,结合现在的例子,就是把交易、商品、用户的数据分开。

优点:

解决了原来把所有业务放在一个数据库中的压力问题。

可以根据业务的特点进行更多的优化

缺点:

需要维护多个数据库

问题:

需要考虑原来跨业务的事务

跨数据库的join

解决问题方案:

我们应该在应用层尽量避免跨数据库的事物,如果非要跨数据库,尽量在代码中控制。

我们可以通过第三方应用来解决,如上面提到的mycat,mycat提供了丰富的跨库join方案,详情可参考mycat官方文档。

垂直拆分后的结构如下:


7.2、数据水平拆分

数据水平拆分就是把同一个表中的数据拆分到两个甚至多个数据库中。产生数据水平拆分的原因是某个业务的数据量或者更新量到达了单个数据库的瓶颈,这时就可以把这个表拆分到两个或更多个数据库中。

优点:

如果我们能客服以上问题,那么我们将能够很好地对数据量及写入量增长的情况。

问题:

访问用户信息的应用系统需要解决SQL路由的问题,因为现在用户信息分在了两个数据库中,需要在进行数据操作时了解需要操作的数据在哪里。

主键的处理也变得不同,例如原来自增字段,现在不能简单地继续使用了。

如果需要分页,就麻烦了。

解决问题方案:

我们还是可以通过可以解决第三方中间件,如mycat。mycat可以通过SQL解析模块对我们的SQL进行解析,再根据我们的配置,把请求转发到具体的某个数据库。

我们可以通过UUID保证唯一或自定义ID方案来解决。

mycat也提供了丰富的分页查询方案,比如先从每个数据库做分页查询,再合并数据做一次分页查询等等。

数据水平拆分后的结构:


阶段八、应用的拆分

8.1、拆分应用

随着业务的发展,业务越来越多,应用越来越大。我们需要考虑如何避免让应用越来越臃肿。这就需要把应用拆开,从一个应用变为俩个甚至更多。还是以我们上面的例子,我们可以把用户、商品、交易拆分开。变成“用户、商品”和“用户,交易”两个子系统。

拆分后的结构:


问题:

这样拆分后,可能会有一些相同的代码,如用户相关的代码,商品和交易都需要用户信息,所以在两个系统中都保留差不多的操作用户信息的代码。如何保证这些代码可以复用是一个需要解决的问题。

解决问题:

通过走服务化的路线来解决

8.2、走服务化的道路

为了解决上面拆分应用后所出现的问题,我们把公共的服务拆分出来,形成一种服务化的模式,简称SOA。

采用服务化之后的系统结构:

优点:

相同的代码不会散落在不同的应用中了,这些实现放在了各个服务中心,使代码得到更好的维护。

我们把对数据库的交互放在了各个服务中心,让”前端“的web应用更注重与浏览器交互的工作。

问题:

如何进行远程的服务调用

解决方法:

我们可以通过下面的引入消息中间件来解决

阶段九、引入消息中间件

随着网站的继续发展,我们的系统中可能出现不同语言开发的子模块和部署在不同平台的子系统。此时我们需要一个平台来传递可靠的,与平台和语言无关的数据,并且能够把负载均衡透明化,能在调用过程中收集调用数据并分析之,推测出网站的访问增长率等等一系列需求,对于网站应该如何成长做出预测。开源消息中间件有阿里的dubbo,可以搭配Google开源的分布式程序协调服务zookeeper实现服务器的注册与发现。

引入消息中间件后的结构:


十、总结

以上的演变过程只是一个例子,并不适合所有的网站,实际中网站演进过程与自身业务和不同遇到的问题有密切的关系,没有固定的模式。只有认真的分析和不断地探究,才能发现适合自己网站的架构。

作者:Java架构
链接:https://www.jianshu.com/p/dc3db4402717
來源:简书
著作权归作者所有。商业转载请联系作者获得授权,非商业转载请注明出处。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.luyixian.cn/news_show_831081.aspx

如若内容造成侵权/违法违规/事实不符,请联系dt猫网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

struts html tld有什么效果_外贸网站域名与网址有什么区别?

在建站过程中,外贸企业都会遇到这样的一个问题,网站应该选择一个什么样的域名呢?可以说,域名就是一个网站的标志,一个好的域名,不仅可以让客户更容易记住,对于网站运营和优化还可以带来意想不到…

不同网站不同网卡_微网站与普通网站究竟有哪些不同之处,优势又在哪

各种网络推广的普及使得一个公司没有网站方面的推广就会大大的落后于同类的有推广的企业。网宣的效果实打实的摆在眼前,这使得人们不得不重视网络的力量。近几年,网上出现了一种新的网站形式,叫微网站。这种网站形式当下也非常的火爆&#xf…

python2.7打开webdriver打不开ie_18个提高效率改变生活的网站,为你打开新世界的大门...

本文由什么值得买用户原创:值行哈喽大家好,这里是值行,我是小编桃子。今天小编要分享18个超赞的网站,每一个都好用到不行!如果你之前没用过这些网站,保证这篇文章带你打开新世界的的大门。1.Firefox Send(临时网盘、私…

使用 html 来创建站点,怎样使用HTML创建免费网站

步骤1:子域。要启动基本网站,您需要获取一个子域。子域是作为常规URL的辅助元素的URL。子域的一个示例是woddlegames.bananimated.com或thezombiefuture.webs.com。为了使您的网站正常运行,我们将使用webs.com来获取我们的子域。创建一个Web帐…

html的细节优化,网站图片优化细节放送(seo技巧)

做seo的老铁们难免会遇到网站图片优化处理不到位,大多数的套话都是围绕着数据来说的,其实这也没什么,重点是我们的细节处理不到位就算数据正确也不好办,那么接下来让凯夜seo为您放送一些图片优化的细节,规整数据的使用…

HTMLCSS 入门:《HTML CSS 设计与构建网站》NOTES------CSS

文章目录《HTML & CSS 设计与构建网站》学习笔记CSS简介颜色盒子列表、表格和表单列表表格表单布局图像HTML布局《HTML & CSS 设计与构建网站》学习笔记 CSS简介 CSS通过将规则和**HTML元素相关联的方式来工作,这些规则用来控制指定元素中的内容如何显示一…

怎么取消https访问_Firefox 74稳定版发布:禁止访问TLS 1.0/1.1的HTTPS网站

适用于Windows、macOS和GNU/Linux桌面平台,Mozilla今天刚刚发布了Firefox 74版本更新,目前用户可以访问官方服务器进行下载。不过目前更新日志并未放出,不过可以确认是首个禁止访问使用TLS 1.0和TLS 1.1的HTTPS 网站的浏览器版本。访问&#…

换肤 本地创建不同的scss文件 分别申明不同的变量_vue教程-vue+sass+环境变量实现网站换肤...

今天给大家分享一个vuecli3.x sass .env环境变量实现网站换肤的效果。本教程实现了,文字颜色、图片、背景图片的更换效果。准备物料:脚手架:vuecli3.xnpm包:node-sass,sass-loader环境变量文件:.env.a, .…

阿里云搭建个人网站:Ubuntu16.04+Nginx+Mysql+PHP 搭建wordpress

前言:想必,搭建个人网站是很多技术流同学的梦想,也是对自身知识的一次小小实践。2020疫情在家期间,时间充裕正好趁此机会搭建属于自己的网站。 搭建个人网站一般选择常用、稳定可靠并且花费便宜的方案。综合考虑之下,…

网站服务器抢单,可以用云服务器抢单嘛

可以用云服务器抢单嘛 内容精选换一换场景公有云支持CSBS应用一致性备份对SAP HANA进行备份,在同一可用区内,通过部署单机SAP HANA,用于存放业务数据,随着数据量的增加,之前的备份方式已经满足不了RTO、RPO的要求&…

未备案域名临时跳过备案提示_网站备案及安装网站后台管理系统教程(阿里云为例)...

昨天把我分享了网站的制作流程,从购买域名到设置服务器,基本都给大家做了一个简单的介绍,下面我再来分享一下如何进行网站备案以及安装网站后台管理系统吧。系统什么是网站后台管理系统?网站后台管理系统主要是用于对网站前台的信…

net导出excel页面不自动刷新_EXCEL---爬取网站数据,小白也能学会

今天要给大家安利的是一个Excel里很简单实用却常常被忽略的功能。在生活工作中对爬取网站数据有需求的你千万不要错过啦~!最近,朋友LJ在研究P2P公司,看到网贷之家一份网贷指数数据,想把它复制到Excel中,便于整理、分析。网址&…

a标签怎么传参_2020年SEO优化-网页的标题标签(Title Tag)要怎么写才是最优化?...

2020年SEO优化-网页的标题标签(Title Tag)要怎么写才是最优化?1、网页的标题标签有效长度是64个字节,汉语是32个字。长出来的部分无益有弊。为什么网页的标题标签太长反而不好?2、标题标签中务必出现这个页面的关键词&…

html设置文字超过字数_独立建站,个人网站,网站TDK设置都有哪些原则

网站TDK设置都有哪些原则一个标准的html页面,头部应该至少包含让搜索引擎蜘蛛辨别的网页标题(title)、页面描述(description)、页面关键词(keywords),这便是我们常说的TDK,用浏览器打开网页,右键查看源代码便可以看到tdk&#xff…

宝塔面板网站一打开cpu百分百_宝塔面板优化之Mysql数据库性能调优

在PHPMYSQL架构网站运行过程中,往往会遇到各种性能问题影响,如MySQL、PHP、CPU、磁盘IO、缓存等,其中MySQL瓶颈就是最常见也最难解决的一种影响网站性能的因素;通常,我们会使用redis、memcached等缓存软件来缓存内容&a…

服务器上的网站怎么打不卡视频,做网站的时候,怎么在网页上播放服务器的视频?...

如何轻松的搭建影音服务器你好~在许多网者局域网用户来说,一般都有自己的影片和音乐库,以供来在上网之余观看。而观看的方式大多都是将影片和音乐文件放在一台或是几台电脑里,用户要观看影片或听音乐时,直接调用文件进行观看。这种…

【站长工具】推荐一个来自微软的网站页面访问分析工具Clarity(支持记录用户行为)

一、前言 官方地址 :https://clarity.microsoft.com/ 这个工具的来源网上已经有很多文章了,但是很少有这个工具的实际使用效果及功能介绍的文章。 我是在各种搜索引擎做收录信息的时候,在必应里找到的这个。其功能比百度站长强了很多&#…

【站长工具】jsdelivr挂了后,我是如何拯救我的个人网站的(halo)

前言 众所周知,在去年年底,知名的免费cdn服务提供商jsdelivr由于大陆域名备案的问题,没有国内的CDN加速了,目前都只能解析到海外,不但速度慢,还会偶发性无法连接到服务器。因此国内超多网站都受到了影响。 有人说可以批量修改引用的url,都改成 unpkg.com,但实测,我的个人网站上…

python3计算生态之从Web解析到网络空间(网络爬虫、Web网站/应用开发)

1、Python库之网络爬虫 Requests:最友好的网络爬虫功能库 -提供了简单易用的类HTTP协议网络爬虫功能,支持连接池、SSL、Cookies、HTTP(S)代理等 -Python最主要的页面级网络爬虫功能库 -网址:http://www.python-requests.org/ import req…

手机无法打开html文件夹,手机网站在电脑上无法打开的解决办法

方法/步骤手机能正常访问而电脑上却不能正常访问的网站,往往有很多情况,最常见的一类是下图1所示的例子,在浏览器地址栏输入网址按回车后,不是进入网站,却是马上弹出下载未知文件的提示,有的人被吓蒙了&…