cli-tools-career 上手两周后的真实感受:哪些设计舒服,哪些让人抓狂
这个问题我断断续续查了两周,中间走了不少弯路,把过程原样记下来,希望后面遇到的人能少花点时间。
-- 出问题的那条查询:在 2000 万行上做了全表扫描 -- 加复合索引后 P99 从 1.8s 降到 42ms SELECT id, title, created_at FROM posts WHERE community_id = ? AND status = 1 ORDER BY score DESC LIMIT 20;
真正让我意外的是长尾。平均值一直很漂亮,P99 却在某个阈值之后直接跳了一个数量级。原因不在 cli-tools-career 本身,而是我们上游的连接复用没做好,压测流量太「干净」,掩盖了长尾请求。
关于取舍,我的判断是:如果团队里没有人长期盯这块,就不要引入第二套机制。两套并存的时候,出问题时你甚至要先花时间判断「这次是哪个在起作用」,那个成本比性能损失高得多。
监控这块我们也顺手改了:把原来的平均值告警换成分位数,并且按接口拆分。改完之后误报少了大概七成,值班同学的怨气肉眼可见地下降了。