SWC·面试 · 踩坑记录:swc-interview 的时区处理差点让线上少算一天

17
SWr/swc-interview·由 chen_dev 发布·5 分钟前教程

踩坑记录:swc-interview 的时区处理差点让线上少算一天

先说结论:swc-interview 这套东西在中小规模下几乎不需要调优,真正开始难受的位置比大多数人以为的靠后得多。下面是完整的实测过程。

排查顺序(按性价比排): 1. 先看下游 RT,八成问题不在自己身上 2. 再看连接池命中率与等待队列长度 3. 然后才是 GC 与内存分配 4. 最后才怀疑框架

第一件事是把变量收敛干净。我们最开始同时在改配置和升级版本,结果两组数据的差异根本说不清是哪个带来的。后来回滚到只动一个变量,重跑了三遍,曲线才稳定下来。这一步很枯燥,但省不掉。

最后提醒一个坑:容器环境下一定要记得同步调整内存相关的参数,否则宿主机的限制和进程内部的预期会对不上,表现就是偶发的、无法复现的失败。

真正让我意外的是长尾。平均值一直很漂亮,P99 却在某个阈值之后直接跳了一个数量级。原因不在 swc-interview 本身,而是我们上游的连接复用没做好,压测流量太「干净」,掩盖了长尾请求。

监控这块我们也顺手改了:把原来的平均值告警换成分位数,并且按接口拆分。改完之后误报少了大概七成,值班同学的怨气肉眼可见地下降了。

5 条评论

5 条评论

我
Wwinter·28 分钟前

楼主说的第 3 点我有不同看法。这里的取舍取决于你的读写比:读多写少的话,加缓存反而会放大不一致窗口。

411
Kkite·3 分钟前

同意上面说的。补充一点:如果开了这个选项,监控指标里的 GC 次数会翻倍,需要同步调整告警阈值,否则会一直误报。

201
Zzhu_zong·刚刚

这里其实有个更简单的做法,不需要改架构:把这一层判断提前到网关,问题就消失了。代价是网关会多一次查表。

376
Rrase·刚刚

想请教一下,这个方案在容器里(内存限制 512Mi)会有什么变化?我们线上就是这么配的。

232
Rran_bo·刚刚

刚翻了下 swc-interview 的源码,作者在注释里其实解释过为什么这么设计,大意是「为了在极端情况下退化成可预期行为」。

183

这是帖子详情页 /zh-CN/c/swc-interview/post/p12。帖子与评论都由种子随机数确定性生成 —— 同一个帖子每次打开内容一致,因此可以直接分享链接、刷新、被搜索引擎收录。真实实现里这一页是 MySQL 读帖子 + Redis 缓存热帖 + 评论树按 path 字段一次性取出。

看数据表设计 →