offline-first-opensource 里那几个容易被忽略的类型细节
先说背景。我们的场景是 offline-first-opensource + 三个下游服务,日均请求量七位数,峰值集中在晚上九点前后。
排查顺序(按性价比排): 1. 先看下游 RT,八成问题不在自己身上 2. 再看连接池命中率与等待队列长度 3. 然后才是 GC 与内存分配 4. 最后才怀疑框架
第一件事是把变量收敛干净。我们最开始同时在改配置和升级版本,结果两组数据的差异根本说不清是哪个带来的。后来回滚到只动一个变量,重跑了三遍,曲线才稳定下来。这一步很枯燥,但省不掉。
关于取舍,我的判断是:如果团队里没有人长期盯这块,就不要引入第二套机制。两套并存的时候,出问题时你甚至要先花时间判断「这次是哪个在起作用」,那个成本比性能损失高得多。
监控这块我们也顺手改了:把原来的平均值告警换成分位数,并且按接口拆分。改完之后误报少了大概七成,值班同学的怨气肉眼可见地下降了。