您当前的位置:首页 > 电脑百科 > 程序开发 > 架构

Clickhouse 在快手的架构和技术内幕

时间:2021-03-11 09:18:59  来源:今日头条  作者:架构漫谈

大家好,短视频软件,快手现在风头正盛,面对如此大的用户量,今天带来 《Clickhouse在快手的架构和技术内幕》

先说下Clickhouse - 越来越多的新型OLAP数据库涌现,无论是 Clickhouse还是Apache Doris都在逐渐变得流行。其背后一定是有原因的。

 

Hadoop那套组件众多,运维压力越来越大,因此新型OLAP相对不依赖hadoop生态,简介的架构的特性就很吸引人。

ClickHouse 是俄罗斯Yandex在2016年开源的性能分析型SQL数据库,主要面向OLAP场景。开源之后,凭借优异的查询性能,受到业界的青睐。

 

Clickhouse 在快手的架构和技术内幕

官网风格清新

 

直观感受有多快:

如图一,clickhouse官网做了很多压测,比较了 MySQL、hive、greenplum、vertica、clickhouse

clickhouse 比 hive 快百倍(这个很正常,大家都想得到),而比 vertica 快几倍,比 greenplum 20倍左右。

 

Clickhouse 在快手的架构和技术内幕

快的一骑绝尘

 

Clickhouse的快速主要是因为 存储和计算都快,这里有一些关键特性。

图二:存储快速的原因: 主键存储、列式、块索引、数据分区、本机存储、多重索引

 

Clickhouse 在快手的架构和技术内幕

 

 

图三:计算快速的原因: 分布式、多线程、向量化、LLVM、RuntimeCodegen

 

Clickhouse 在快手的架构和技术内幕

 

 

快手使用Clickhouse的规模,截至2019年底。 (图四)

  • 存储了 10PB数据;
  • 每天新增200TB数据;
  • 每天查询 50w;
  • 查询的时延(P90) < 3s

 

Clickhouse 在快手的架构和技术内幕

 

快手使用Clickhouse的场景:

这个都比较常见,无非是 BI系统、报表系统、监控系统、ABTEST和用户分析系统

(小编注:

- 报表系统一般指的是传统的、类似Excel的多表头复杂中国式报表,一般每一个单元格都是有单独计算逻辑;

- BI一般是在数据仓库建设完成后,可以通过BI软件自助分析的图表;

- 监控系统一般是一个酷炫的大屏

 

图五,快手Clickhouse的部署架构;

 

Clickhouse 在快手的架构和技术内幕

 

 

多集群是必须的,通过一个路由进行分流,做一些类似“切面”“网关”做的工作。

数据则是通过 mapreduce(无论是 hive、sparksql 还是其他) 和 flink 进入clickhouse

Clickhouse在单表的情况下性能比多表join好很多,快手因此总结了一些最佳实践。见图六

 

Clickhouse 在快手的架构和技术内幕

 

 

如果是普通企业,到此也差不多了,快手由于业务量大,仍遇到了一些问题难以解决,针对问题,快手提出了Clickhouse on Hdfs 的方案,即存储和计算分离,存储使用hadoop hdfs。自己基于接口重写了 HdfsMergeTree实现。

 

Clickhouse 在快手的架构和技术内幕

架构示意


Clickhouse 在快手的架构和技术内幕

自研HdfsMergeTree 存储引擎

具体涉及的优化点很多,细节相对有深度,这里就不多说了,看一下图九的总结。

Clickhouse 在快手的架构和技术内幕

 

欢迎 点赞、转发 !

您的支持是我更新的动力!



Tags:Clickhouse   点击:()  评论:()
声明:本站部分内容及图片来自互联网,转载是出于传递更多信息之目的,内容观点仅代表作者本人,如有任何标注错误或版权侵犯请与我们联系(Email:2595517585@qq.com),我们将及时更正、删除,谢谢。
▌相关推荐
公司使用mybatis-plus版本为3.0.7.1,mybatis-plus3.4.2对clickhouse是支持的,无奈怕升级影响大,只能在现有基础上调整mybatis-plus代码了。 mybatis 在项目中将mybatis-plus源...【详细内容】
2021-05-27  Tags: Clickhouse  点击:(1579)  评论:(0)  加入收藏
大家好,短视频软件,快手现在风头正盛,面对如此大的用户量,今天带来 《Clickhouse在快手的架构和技术内幕》先说下Clickhouse - 越来越多的新型OLAP数据库涌现,无论是 Clickhouse...【详细内容】
2021-03-11  Tags: Clickhouse  点击:(646)  评论:(0)  加入收藏
ClickHouse 具有 ROLAP、在线实时查询、完整的 DBMS、列式存储、不需要任何数据预处理、支持批量更新、拥有非常完善的 SQL 支持和函数、支持高可用、不依赖 Hadoop 复杂生...【详细内容】
2020-07-15  Tags: Clickhouse  点击:(331)  评论:(0)  加入收藏
▌简易百科推荐
为了构建高并发、高可用的系统架构,压测、容量预估必不可少,在发现系统瓶颈后,需要有针对性地扩容、优化。结合楼主的经验和知识,本文做一个简单的总结,欢迎探讨。1、QPS保障目标...【详细内容】
2021-12-27  大数据架构师    Tags:架构   点击:(3)  评论:(0)  加入收藏
前言 单片机开发中,我们往往首先接触裸机系统,然后到RTOS,那么它们的软件架构是什么?这是我们开发人员必须认真考虑的问题。在实际项目中,首先选择软件架构是非常重要的,接下来我...【详细内容】
2021-12-23  正点原子原子哥    Tags:架构   点击:(7)  评论:(0)  加入收藏
现有数据架构难以支撑现代化应用的实现。 随着云计算产业的快速崛起,带动着各行各业开始自己的基于云的业务创新和信息架构现代化,云计算的可靠性、灵活性、按需计费的高性价...【详细内容】
2021-12-22    CSDN  Tags:数据架构   点击:(10)  评论:(0)  加入收藏
▶ 企业级项目结构封装释义 如果你刚毕业,作为Java新手程序员进入一家企业,拿到代码之后,你有什么感觉呢?如果你没有听过多模块、分布式这类的概念,那么多半会傻眼。为什么一个项...【详细内容】
2021-12-20  蜗牛学苑    Tags:微服务   点击:(8)  评论:(0)  加入收藏
我是一名程序员关注我们吧,我们会多多分享技术和资源。进来的朋友,可以多了解下青锋的产品,已开源多个产品的架构版本。Thymeleaf版(开源)1、采用技术: springboot、layui、Thymel...【详细内容】
2021-12-14  青锋爱编程    Tags:后台架构   点击:(20)  评论:(0)  加入收藏
在了解连接池之前,我们需要对长、短链接建立初步认识。我们都知道,网络通信大部分都是基于TCP/IP协议,数据传输之前,双方通过“三次握手”建立连接,当数据传输完成之后,又通过“四次挥手”释放连接,以下是“三次握手”与“四...【详细内容】
2021-12-14  架构即人生    Tags:连接池   点击:(16)  评论:(0)  加入收藏
随着移动互联网技术的快速发展,在新业务、新领域、新场景的驱动下,基于传统大型机的服务部署方式,不仅难以适应快速增长的业务需求,而且持续耗费高昂的成本,从而使得各大生产厂商...【详细内容】
2021-12-08  架构驿站    Tags:分布式系统   点击:(23)  评论:(0)  加入收藏
本系列为 Netty 学习笔记,本篇介绍总结Java NIO 网络编程。Netty 作为一个异步的、事件驱动的网络应用程序框架,也是基于NIO的客户、服务器端的编程框架。其对 Java NIO 底层...【详细内容】
2021-12-07  大数据架构师    Tags:Netty   点击:(16)  评论:(0)  加入收藏
前面谈过很多关于数字化转型,云原生,微服务方面的文章。虽然自己一直做大集团的SOA集成平台咨询规划和建设项目,但是当前传统企业数字化转型,国产化和自主可控,云原生,微服务是不...【详细内容】
2021-12-06  人月聊IT    Tags:架构   点击:(23)  评论:(0)  加入收藏
微服务看似是完美的解决方案。从理论上来说,微服务提高了开发速度,而且还可以单独扩展应用的某个部分。但实际上,微服务带有一定的隐形成本。我认为,没有亲自动手构建微服务的经历,就无法真正了解其复杂性。...【详细内容】
2021-11-26  GreekDataGuy  CSDN  Tags:单体应用   点击:(35)  评论:(0)  加入收藏
最新更新
栏目热门
栏目头条