招聘:远程 capacitor-ops 工程师(全职 / 可长期)
这个问题我断断续续查了两周,中间走了不少弯路,把过程原样记下来,希望后面遇到的人能少花点时间。
真正让我意外的是长尾。平均值一直很漂亮,P99 却在某个阈值之后直接跳了一个数量级。原因不在 capacitor-ops 本身,而是我们上游的连接复用没做好,压测流量太「干净」,掩盖了长尾请求。
-- 出问题的那条查询:在 2000 万行上做了全表扫描 -- 加复合索引后 P99 从 1.8s 降到 42ms SELECT id, title, created_at FROM posts WHERE community_id = ? AND status = 1 ORDER BY score DESC LIMIT 20;
监控这块我们也顺手改了:把原来的平均值告警换成分位数,并且按接口拆分。改完之后误报少了大概七成,值班同学的怨气肉眼可见地下降了。
最后提醒一个坑:容器环境下一定要记得同步调整内存相关的参数,否则宿主机的限制和进程内部的预期会对不上,表现就是偶发的、无法复现的失败。