您当前的位置:首页 > 电脑百科 > 数据库 > Redis

P99下降70%!一次访问Redis延时高问题排查与解决方案(实战案例)

时间:2023-09-04 12:08:48  来源:  作者:dbaplus社群

一、背景

2023年03月08日,在某地域进行了线上压测,发现接口RT频繁超时,性能下降严重,P50 400ms+,P90 1200ms+,P99 2000ms+。

细致排查发现其中重要的原因是,访问缓存rt竟然飙到了1.2s左右。

作为高性能爱好者,榨干CPU的每一分价值是我们的宗旨,士可忍孰不可忍,怎么能光空转,不干活呢?那就仔细分析下问题。

二、为啥redis访问延时如此高?

我们简化下Redis访问流程如下:

可能性1:服务端问题?

我们Redis使用的

redis_amber_master_4xlarge_multithread 16C32G+480G SSD 规格,最大QPS参考值24w,最大连接数3w,配置还是非常豪华的。

如下,QPS以及Load在峰值请求阶段,都仍然处于低位。

可能性2:物理网络问题?

如下,请求远远没有达到机器带宽,不是瓶颈,另外单独看了网卡重传率等指标也都正常。

可能性3:客户端问题?

那么很大概率就是客户端自身问题了。我们把客户端详细放大如下:

①JVM FGC STW?

根据当时ARMS监控结果如下,虽然YGC次数与耗时有所上升,但没有发生FGC:

②JedisPool问题?

内存Dump出来,分析JedisConnectionFactory几个相关重要指标,发现问题有如下2个:

  • maxBorrowWAItTimeMills过大:即最大等待时间过久。在等待从连接池中获取连接,最大等待了1200ms。很大概率是因为block在连接池获取,导致请求处理缓慢。
  • Redis连接创建销毁次数过多:createdCount 11555次;destroyedCount:11553次。说明max-idle参数设置不合理(on return的时候检查idle是否大于maxIdle,如果大于则直接销毁该连接)。每个对象的创建就是一次TCP连接的创建,开销较大。导致脉冲式请求过来时引发频繁创建/销毁,也会影响整体性能。

顺便说一句:maxBorrowWaitTimeMills,createdCount,destroyedCount 几个metrics信息是JedisPool对象持久维护的全局变量信息,只要JVM不重启,这个信息就会一直存在。这也就是为啥不需要在压测峰值时获取内存dump,而是事后dump也可以。

此外,如果细致探索JedisPool参数工作机制,就需要了解Apache的ObjectPool2的机制。刚好笔者在之前研究过ObjectPool,后续会出单独文章阐述&对比ObjectPool,ObjectPool2,JedisPool以及经常踩坑的DruidPool的实现原理与差异。

至此,定位问题是JedisPool行为异常导致。

三、如何解决问题?

线上JedisPool实际参数

部分参数是由 redis.clients.jedis.JedisPoolConfig 继承而来

spring.redis.jedis.pool.max-active=100

spring.redis.jedis.pool.max-idle=16

spring.redis.jedis.pool.time-between-eviction-runs-millis=30000

spring.redis.jedis.pool.min-idle=0

spring.redis.jedis.pool.test-while-idle=true

spring.redis.jedis.pool.num-tests-per-eviction-run=-1

spring.redis.jedis.pool.min-evictable-idle-time-millis=60000

参数行为解析

  • max-active:连接池的最大数量为100, 包括 idle + active. 注意, 这里spring.redis.jedis.pool.max-active被映射为了ObjectPool的maxTotal参数上。
  • 连接池的最大空闲数量为16,即如果return时,idleObject>=16,则该对象直接被销毁。
  • 启动后台线程,每30s执行一次,定时心跳保活与检测。
  • 连接池最小空闲的连接数量为0。即corePoolSize为0,不会长期maintain一个固定的容量。

脉冲式请求引发的问题

我们把问题简化为如下序列,即可发现问题所在。在T2~T3内,84个对象创建,84个对象销毁,造成了极大的损耗。

期望的行为模式

由于线上环境,Redis服务器配置较高,为了能充分压榨性能,同时应对容器场景下典型的突发峰值,因此如下行为:

  • 连接池的最大数量=连接池的最小数量=连接池的稳定数量,即不要临时去创建连接,防止等待过久。
  • 需要定时心跳保活与检测,及时删除掉超时/无效的连接。
  • 不要因为idle时间过久而重建连接(只因为连接失效而重建)。防止无意义的大规模连接重建。
  •  

spring.redis.jedis.pool.max-active=500 // 线上稳定保有4台,4*500=2000,仍然远小于Redis规格支持的3w

spring.redis.jedis.pool.max-idle=50

spring.redis.jedis.pool.time-between-eviction-runs-millis=30000 // 定时心跳保活与检测

spring.redis.jedis.pool.min-idle=500 // 连接池的稳定数量

spring.redis.jedis.pool.test-while-idle=true //定时心跳保活与检测

spring.redis.jedis.pool.num-tests-per-eviction-run=-1 // 每次保活检测, 都需要把500个连接都检测一遍. 如果设置为-2, 则每次检测1/2比例的的连接.

spring.redis.jedis.pool.min-evictable-idle-time-millis=-1 // 不要因为idleTime大于某个阈值从而把连接给删除掉. 这样可以防止无意义的大规模连接重建。

四、效果验证

终于在20230413重新迎来了一波压测,流量模型与上次相同。结果如下:

  • maxBorrowWaitTimeMills 下降比例接近 80%
  • createdCount 也从之前的 11555次 下降到了 500次(即池子初始化的size)
  • 业务侧整体性能也大幅提升,P50与P90均下降了将近60%,P99更是夸张地下降了70%。简直是amazing,完结撒花!~

作者丨寒亭

来源丨公众号:阿里开发者(ID:ali_tech)



Tags:Redis   点击:()  评论:()
声明:本站部分内容及图片来自互联网,转载是出于传递更多信息之目的,内容观点仅代表作者本人,不构成投资建议。投资者据此操作,风险自担。如有任何标注错误或版权侵犯请与我们联系,我们将及时更正、删除。
▌相关推荐
Redis 不再 “开源”,未来采用 SSPLv1 和 RSALv2 许可证
Redis 官方于21日宣布修改开源协议 —— 未来所有版本都将使用 “源代码可用” 的许可证 (source-available licenses)。具体来说,Redis 将不再遵循 BSD 3-Clause...【详细内容】
2024-03-27  Search: Redis  点击:(11)  评论:(0)  加入收藏
Redis“叛逃”开源,得罪了几乎所有人
内存数据库供应商Redis近日在开源界砸下了一块“巨石”。Redis即将转向双许可模式,并实施更为严格的许可条款。官方对此次变更的公告直截了当:从Redis 7.4版本开始,Redis将在Re...【详细内容】
2024-03-25  Search: Redis  点击:(9)  评论:(0)  加入收藏
如何使用 Redis 实现消息队列
Redis不仅是一个强大的内存数据存储系统,它还可以用作一个高效的消息队列。消息队列是应用程序间或应用程序内部进行异步通信的一种方式,它允许数据生产者将消息放入队列中,然...【详细内容】
2024-03-22  Search: Redis  点击:(17)  评论:(0)  加入收藏
Redis不再 “开源”
Redis 官方今日宣布修改开源协议 —— 未来所有版本都将使用 “源代码可用” 的许可证 (source-available licenses)。具体来说,Redis 将不再遵循 BSD 3-Clause 开...【详细内容】
2024-03-21  Search: Redis  点击:(8)  评论:(0)  加入收藏
在Redis中如何实现分布式锁的防死锁机制?
在Redis中实现分布式锁是一个常见的需求,可以通过使用Redlock算法来防止死锁。Redlock算法是一种基于多个独立Redis实例的分布式锁实现方案,它通过协调多个Redis实例之间的锁...【详细内容】
2024-02-20  Search: Redis  点击:(47)  评论:(0)  加入收藏
手动撸一个 Redis 分布式锁
大家好呀,我是楼仔。今天第一天开工,收拾心情,又要开始好好学习,好好工作了。对于使用 Java 的小伙伴,其实我们完全不用手动撸一个分布式锁,直接使用 Redisson 就行。但是因为这些...【详细内容】
2024-02-19  Search: Redis  点击:(39)  评论:(0)  加入收藏
工作中Redis有哪些好用的运维工具
工作中使用 Redis 时,如果大家公司没有专业运维,可能开发人员就会面临这些运维的工作,包括 Redis 的运行状态监控,数据迁移,主从集群、切片集群的部署和运维等等。本文我就从这三...【详细内容】
2024-02-06  Search: Redis  点击:(55)  评论:(0)  加入收藏
深入Go底层原理,重写Redis中间件实战
Go语言以其简洁、高效和并发性能而闻名,深入了解其底层原理可以帮助我们更好地利用其优势。在本文中,我们将探讨如何深入Go底层原理,以及如何利用这些知识重新实现一个简单的Re...【详细内容】
2024-01-25  Search: Redis  点击:(66)  评论:(0)  加入收藏
批量执行Redis命令的四种方式!
前言在我们的印象中Redis命令好像都是一个个单条进行执行的,如果有人问你如何批量执行Redis命令,你能回答的上吗,或者说能答出几种方式呢?最容易想到的是Redis的一些批量命令,例...【详细内容】
2024-01-17  Search: Redis  点击:(58)  评论:(0)  加入收藏
Redis 实现多规则限流的思考与实践
市面上很多介绍redis如何实现限流的,但是大部分都有一个缺点,就是只能实现单一的限流,比如1分钟访问1次或者60分钟访问10次这种,但是如果想一个接口两种规则都需要满足呢,我们的...【详细内容】
2024-01-03  Search: Redis  点击:(109)  评论:(0)  加入收藏
▌简易百科推荐
Redis 不再 “开源”,未来采用 SSPLv1 和 RSALv2 许可证
Redis 官方于21日宣布修改开源协议 —— 未来所有版本都将使用 “源代码可用” 的许可证 (source-available licenses)。具体来说,Redis 将不再遵循 BSD 3-Clause...【详细内容】
2024-03-27  dbaplus社群    Tags:Redis   点击:(11)  评论:(0)  加入收藏
Redis“叛逃”开源,得罪了几乎所有人
内存数据库供应商Redis近日在开源界砸下了一块“巨石”。Redis即将转向双许可模式,并实施更为严格的许可条款。官方对此次变更的公告直截了当:从Redis 7.4版本开始,Redis将在Re...【详细内容】
2024-03-25    51CTO  Tags:Redis   点击:(9)  评论:(0)  加入收藏
如何使用 Redis 实现消息队列
Redis不仅是一个强大的内存数据存储系统,它还可以用作一个高效的消息队列。消息队列是应用程序间或应用程序内部进行异步通信的一种方式,它允许数据生产者将消息放入队列中,然...【详细内容】
2024-03-22  后端Q  微信公众号  Tags:Redis   点击:(17)  评论:(0)  加入收藏
Redis不再 “开源”
Redis 官方今日宣布修改开源协议 —— 未来所有版本都将使用 “源代码可用” 的许可证 (source-available licenses)。具体来说,Redis 将不再遵循 BSD 3-Clause 开...【详细内容】
2024-03-21  OSC开源社区    Tags:Redis   点击:(8)  评论:(0)  加入收藏
在Redis中如何实现分布式锁的防死锁机制?
在Redis中实现分布式锁是一个常见的需求,可以通过使用Redlock算法来防止死锁。Redlock算法是一种基于多个独立Redis实例的分布式锁实现方案,它通过协调多个Redis实例之间的锁...【详细内容】
2024-02-20  编程技术汇    Tags:Redis   点击:(47)  评论:(0)  加入收藏
手动撸一个 Redis 分布式锁
大家好呀,我是楼仔。今天第一天开工,收拾心情,又要开始好好学习,好好工作了。对于使用 Java 的小伙伴,其实我们完全不用手动撸一个分布式锁,直接使用 Redisson 就行。但是因为这些...【详细内容】
2024-02-19  楼仔  微信公众号  Tags:Redis   点击:(39)  评论:(0)  加入收藏
工作中Redis有哪些好用的运维工具
工作中使用 Redis 时,如果大家公司没有专业运维,可能开发人员就会面临这些运维的工作,包括 Redis 的运行状态监控,数据迁移,主从集群、切片集群的部署和运维等等。本文我就从这三...【详细内容】
2024-02-06  waynaqua    Tags:Redis   点击:(55)  评论:(0)  加入收藏
批量执行Redis命令的四种方式!
前言在我们的印象中Redis命令好像都是一个个单条进行执行的,如果有人问你如何批量执行Redis命令,你能回答的上吗,或者说能答出几种方式呢?最容易想到的是Redis的一些批量命令,例...【详细内容】
2024-01-17  小许code  微信公众号  Tags:Redis命令   点击:(58)  评论:(0)  加入收藏
Redis 实现多规则限流的思考与实践
市面上很多介绍redis如何实现限流的,但是大部分都有一个缺点,就是只能实现单一的限流,比如1分钟访问1次或者60分钟访问10次这种,但是如果想一个接口两种规则都需要满足呢,我们的...【详细内容】
2024-01-03  架构精进之路  微信公众号  Tags:Redis   点击:(109)  评论:(0)  加入收藏
一站式Redis解决方案
Redis是一个高效的内存数据库,它支持包括String、List、Set、SortedSet和Hash等数据类型的存储,在Redis中通常根据数据的key查询其value值,Redis没有模糊条件查询,在面对一些需...【详细内容】
2024-01-01  大雷家吃饭    Tags:Redis   点击:(66)  评论:(0)  加入收藏
站内最新
站内热门
站内头条