一图看懂 replication-interview 的执行流程(含时序图)
先说背景。我们的场景是 replication-interview + 三个下游服务,日均请求量七位数,峰值集中在晚上九点前后。
真正让我意外的是长尾。平均值一直很漂亮,P99 却在某个阈值之后直接跳了一个数量级。原因不在 replication-interview 本身,而是我们上游的连接复用没做好,压测流量太「干净」,掩盖了长尾请求。
-- 出问题的那条查询:在 2000 万行上做了全表扫描 -- 加复合索引后 P99 从 1.8s 降到 42ms SELECT id, title, created_at FROM posts WHERE community_id = ? AND status = 1 ORDER BY score DESC LIMIT 20;
最后提醒一个坑:容器环境下一定要记得同步调整内存相关的参数,否则宿主机的限制和进程内部的预期会对不上,表现就是偶发的、无法复现的失败。
监控这块我们也顺手改了:把原来的平均值告警换成分位数,并且按接口拆分。改完之后误报少了大概七成,值班同学的怨气肉眼可见地下降了。
第一件事是把变量收敛干净。我们最开始同时在改配置和升级版本,结果两组数据的差异根本说不清是哪个带来的。后来回滚到只动一个变量,重跑了三遍,曲线才稳定下来。这一步很枯燥,但省不掉。