基于redis实现高可用,易拓展,接入方便,生产环境稳定运行的延迟队列
延迟队列,顾名思义它是一种带有延迟功能的消息队列。 那么,是在什么场景下我才需要这样的队列呢?
先看看一下业务场景: * 1.会员过期前3天发送召回通知 * 2.订单支付成功后,5分钟后检测下游环节是否都正常,比如用户购买会员后,各种会员状态是否都设置成功 * 3.如何定期检查处于退款状态的订单是否已经退款成功? * 4.实现通知失败,1,3,5,7分钟重复通知,直到对方回复?
通常解决以上问题,最简单直接的办法就是定时去扫表。
扫表存在的问题是:
延时队列能对于上述需求能很好的解决
调研了市场上一些开源的方案,以下: * 1.有赞科技:只有原理,没有开源代码 * 2.github个人的:https://github.com/ouqiang/delay-queue
1.基于redis实现,redis只能配置一个,如果redis挂了整个服务不可用,可用性差点 2.消费端实现的是拉模式,接入成本大,每个项目都得去实现一遍接入代码 3.在star使用的人数不多,放在生产环境,存在风险,加之对go语言不了解,出了问题难以维护
基本以上原因打算自己写一个,平常使用php多,项目基本redis的zset结构作为存储,用php语言实现 ,实现原理参考了有赞团队:https://tech.youzan.com/queuing_delay/
整个延迟队列主要由4个部分
消息结构 每个Job必须包含一下几个属性:
对于同一类的topic delaytime,ttr一般是固定,job可以在精简一下属性
1.topic:Job类型。可以理解成具体的业务名称
2.id:Job的唯一标识。用来检索和删除指定的Job信息。
3.body:Job的内容,供消费者做具体的业务处理,以json格式存储。
delaytime,ttr在topicadmin后台配置
总体架构
采用master-work架构模式,主要包括6个模块:
消息写入:
timer查找到期消息:
consumer消费流程:
环境依赖:
PHP 5.5+ 安装sockets,redis,pcntl,pdo_mysql 拓展
ps: 熟悉docker的同学可以直接用镜像: shareclz/php7.2.14 里面包含了所需拓展
执行:
mysql> source dq.sql
在DqConf.php文件中修改php了路径 $phpBin
命令:
php DqHttpServer.php --port 8088
访问:http://127.0.0.1:8088,出现配置界面
redis信息格式:host:port:auth 比如 127.0.0.1:6379:12345
重试标记说明:
1.接口返回为空默认重试 2.满足指定返回表达会重试,res表示返回的json数组,比如: 回调接口返回json串:{"code":200,"data":{"status":2,"msg":"返回失败"}},重试条件可以这样写 {res.code}!=200 {res.code}!=200 && {res.data.status}!=2 {res.code}==200 && {res.data.status}==2 || {res.data.msg}=='返回失败'
php DqInit.php --port 6789 &
执行 ps -ef | grep dq 看到如下信息说明启动成功
默认日志目录在项目目录的logs目录下,在DqConf.php修改$logPath
ps -ef | grep dq-master| grep -v grep | head -n 1 | awk '{print $2}' | xargs kill -USR2
需要安装pthreads拓展:
测试原理:使用多线程模拟并发,在1s内能成功返回请求成功的个数
php DqBench concurrency requests concurrency:并发数 requests: 每个并发产生的请求数测试环境:内存 8G ,8核cpu,2个redis和1个dq-server 部署在一个机器上,数据包64字节 qps:2400
1.如果调用通知接口在超时时间内,没有收到回复认为通知失败,系统会重新把数据放入队列,重新通知,系统默认最大通知10次(可以在Dqconf.php文件中修改$notifyexpnums)通知间隔为2n+1,比如第一次1分钟,通知失败,第二次3分钟后,直到收到回复,超出最大通知次数后系统自动丢弃,同时发邮件通知
2.线上redis每隔1s持久化一次,存在丢失1s数据的情况,出现这种情况可以对比requestymd.txt和notifyymd.txt日志手动恢复过来
3.redis宕机通知:
ps:网络抖动在所难免,通知接口如果涉及到核心的服务,一定要保证幂等!!
线上部署了两个实例每个机房部一个,4个redis共16G内存作存储,服务稳定运行数月,各项指标均符合预期
主要接入业务:
1.由于团队使用的镜像缺少libevent拓展,所以dq-server基于select模型,并发高的场景下性能存在瓶颈,后续可以改为基于libevent事件模型,提升并发性能
2.timer和consumer目前是采用多进程来做的,这个粒度感觉有点粗,可以考虑使用多线程模式,并且支持动态创建线程数来提高consumer的性能,最大程度保证消费及时
3.dq-server与redis是同步调用,这也是性能的瓶颈点,计划基于swoole_redis来异步处理
https://www.cnblogs.com/peachyy/p/7398430.html
https://tech.youzan.com/queuing_delay/
http://www.runoob.com/bootstrap/bootstrap-tutorial.html
bug、修改建议、疑惑都欢迎提在issue中,或加入本人qq:490103404
2018.11.24
测试网络框架切换到swoole和使用异步swoole_redis带来的性能改变情况 把dqserver的主要逻辑基于swoole重新写了一遍,测试机(内存4G,cpu个数4)
启动sever:
php testswooleserver.php 9055
压测:
php testswoolebench.php 100 56
结果:
写入性能提升:2.6倍
引入swoole性能提升比较明显,不过目前暂时不打算把server改为swoole的方式,主要基于以下考虑
2018.11.25
新增队列消费分优先级(高,中,低3级),高优任务可以优先消费 消费比例在DqConf::$priorityConfig配置,默认按照5:3:2的比例消费