您当前的位置：首页 > 电脑百科 > 程序开发 > 架构

Clickhouse 在快手的架构和技术内幕

时间：2021-03-11 09:18:59 来源：今日头条作者：架构漫谈

+ 加入收藏

大家好，短视频软件，快手现在风头正盛，面对如此大的用户量，今天带来《Clickhouse在快手的架构和技术内幕》

先说下Clickhouse - 越来越多的新型OLAP数据库涌现，无论是 Clickhouse还是Apache Doris都在逐渐变得流行。其背后一定是有原因的。

Hadoop那套组件众多，运维压力越来越大，因此新型OLAP相对不依赖hadoop生态，简介的架构的特性就很吸引人。

ClickHouse 是俄罗斯Yandex在2016年开源的性能分析型SQL数据库，主要面向OLAP场景。开源之后，凭借优异的查询性能，受到业界的青睐。

官网风格清新

直观感受有多快：

如图一，clickhouse官网做了很多压测，比较了 MySQL、hive、greenplum、vertica、clickhouse

clickhouse 比 hive 快百倍（这个很正常，大家都想得到），而比 vertica 快几倍，比 greenplum 20倍左右。

快的一骑绝尘

Clickhouse的快速主要是因为存储和计算都快，这里有一些关键特性。

图二：存储快速的原因：主键存储、列式、块索引、数据分区、本机存储、多重索引

图三：计算快速的原因：分布式、多线程、向量化、LLVM、RuntimeCodegen

快手使用Clickhouse的规模，截至2019年底。（图四）

存储了 10PB数据；
每天新增200TB数据；
每天查询 50w；
查询的时延（P90) < 3s

快手使用Clickhouse的场景：

这个都比较常见，无非是 BI系统、报表系统、监控系统、ABTEST和用户分析系统

（小编注：

- 报表系统一般指的是传统的、类似Excel的多表头复杂中国式报表，一般每一个单元格都是有单独计算逻辑；

- BI一般是在数据仓库建设完成后，可以通过BI软件自助分析的图表；

- 监控系统一般是一个酷炫的大屏）

图五，快手Clickhouse的部署架构；

多集群是必须的，通过一个路由进行分流，做一些类似“切面”“网关”做的工作。

数据则是通过 mapreduce（无论是 hive、sparksql 还是其他）和 flink 进入clickhouse。

Clickhouse在单表的情况下性能比多表join好很多，快手因此总结了一些最佳实践。见图六。

如果是普通企业，到此也差不多了，快手由于业务量大，仍遇到了一些问题难以解决，针对问题，快手提出了Clickhouse on Hdfs 的方案，即存储和计算分离，存储使用hadoop hdfs。自己基于接口重写了 HdfsMergeTree实现。

架构示意

自研HdfsMergeTree 存储引擎

具体涉及的优化点很多，细节相对有深度，这里就不多说了，看一下图九的总结。

欢迎点赞、转发！

您的支持是我更新的动力！

Tags：Clickhouse 点击:() 评论:()

声明：本站部分内容及图片来自互联网,转载是出于传递更多信息之目的,内容观点仅代表作者本人,如有任何标注错误或版权侵犯请与我们联系(Email:2595517585@qq.com)，我们将及时更正、删除，谢谢。

▌相关推荐

mybatis-plus整合clickhouse

公司使用mybatis-plus版本为3.0.7.1，mybatis-plus3.4.2对clickhouse是支持的，无奈怕升级影响大，只能在现有基础上调整mybatis-plus代码了。 mybatis 在项目中将mybatis-plus源...【详细内容】

2021-05-27　　Tags: Clickhouse 点击:(1579)　　评论:(0)　　加入收藏

Clickhouse 在快手的架构和技术内幕

大家好，短视频软件，快手现在风头正盛，面对如此大的用户量，今天带来《Clickhouse在快手的架构和技术内幕》先说下Clickhouse - 越来越多的新型OLAP数据库涌现，无论是 Clickhouse...【详细内容】

2021-03-11　　Tags: Clickhouse 点击:(646)　　评论:(0)　　加入收藏

ClickHouse 为何如此快？

ClickHouse 具有 ROLAP、在线实时查询、完整的 DBMS、列式存储、不需要任何数据预处理、支持批量更新、拥有非常完善的 SQL 支持和函数、支持高可用、不依赖 Hadoop 复杂生...【详细内容】

2020-07-15　　Tags: Clickhouse 点击:(331)　　评论:(0)　　加入收藏

▌简易百科推荐

架构师才需要知道的知识：如何做容量预估和调优

为了构建高并发、高可用的系统架构，压测、容量预估必不可少，在发现系统瓶颈后，需要有针对性地扩容、优化。结合楼主的经验和知识，本文做一个简单的总结，欢迎探讨。1、QPS保障目标...【详细内容】

2021-12-27　　大数据架构师　　　　Tags:架构　点击:(3)　　评论:(0)　　加入收藏

嵌入式程序架构--你了解多少？

前言单片机开发中，我们往往首先接触裸机系统，然后到RTOS，那么它们的软件架构是什么?这是我们开发人员必须认真考虑的问题。在实际项目中，首先选择软件架构是非常重要的，接下来我...【详细内容】

2021-12-23　　正点原子原子哥　　　　Tags:架构　点击:(7)　　评论:(0)　　加入收藏

我们需要一次怎样的数据架构变革？

现有数据架构难以支撑现代化应用的实现。随着云计算产业的快速崛起，带动着各行各业开始自己的基于云的业务创新和信息架构现代化，云计算的可靠性、灵活性、按需计费的高性价...【详细内容】

2021-12-22　　　　CSDN　　Tags:数据架构　点击:(10)　　评论:(0)　　加入收藏

微服务项目到底如何分模块？

▶ 企业级项目结构封装释义如果你刚毕业，作为Java新手程序员进入一家企业，拿到代码之后，你有什么感觉呢？如果你没有听过多模块、分布式这类的概念，那么多半会傻眼。为什么一个项...【详细内容】

2021-12-20　　蜗牛学苑　　　　Tags:微服务　点击:(8)　　评论:(0)　　加入收藏

开源的springboot+thymeleaf后台架构，程序员用了都点赞

我是一名程序员关注我们吧，我们会多多分享技术和资源。进来的朋友，可以多了解下青锋的产品，已开源多个产品的架构版本。Thymeleaf版（开源）1、采用技术： springboot、layui、Thymel...【详细内容】

2021-12-14　　青锋爱编程　　　　Tags:后台架构　点击:(20)　　评论:(0)　　加入收藏

长链接、短链接与连接池

在了解连接池之前，我们需要对长、短链接建立初步认识。我们都知道，网络通信大部分都是基于TCP/IP协议，数据传输之前，双方通过“三次握手”建立连接，当数据传输完成之后，又通过“四次挥手”释放连接，以下是“三次握手”与“四...【详细内容】

2021-12-14　　架构即人生　　　　Tags:连接池　点击:(16)　　评论:(0)　　加入收藏

分布式系统 Etcd 解析

随着移动互联网技术的快速发展，在新业务、新领域、新场景的驱动下，基于传统大型机的服务部署方式，不仅难以适应快速增长的业务需求，而且持续耗费高昂的成本，从而使得各大生产厂商...【详细内容】

2021-12-08　　架构驿站　　　　Tags:分布式系统　点击:(23)　　评论:(0)　　加入收藏

阿里架构师整理的 Netty 学习笔记之：Java NIO 网络编程

本系列为 Netty 学习笔记，本篇介绍总结Java NIO 网络编程。Netty 作为一个异步的、事件驱动的网络应用程序框架，也是基于NIO的客户、服务器端的编程框架。其对 Java NIO 底层...【详细内容】

2021-12-07　　大数据架构师　　　　Tags:Netty 　点击:(16)　　评论:(0)　　加入收藏

传统IT架构转型，从云原生平台到微服务应用构建

前面谈过很多关于数字化转型，云原生，微服务方面的文章。虽然自己一直做大集团的SOA集成平台咨询规划和建设项目，但是当前传统企业数字化转型，国产化和自主可控，云原生，微服务是不...【详细内容】

2021-12-06　　人月聊IT　　　　Tags:架构　点击:(23)　　评论:(0)　　加入收藏

放弃微服务，构建单体应用

微服务看似是完美的解决方案。从理论上来说，微服务提高了开发速度，而且还可以单独扩展应用的某个部分。但实际上，微服务带有一定的隐形成本。我认为，没有亲自动手构建微服务的经历，就无法真正了解其复杂性。...【详细内容】

2021-11-26　　GreekDataGuy　　CSDN　　Tags:单体应用　点击:(35)　　评论:(0)　　加入收藏

推荐资讯

远程软件发展迅猛，ToDe	倒计时！企业QQ即将下架
极简Windows11与iPhon	iPhone信号问题，花10元
惊人数据：App Store中4	个人所得税递延纳税报
非常实用的 Python 库	等离子电视技术先进，为

ClickHouse 为何如此快？