接手时,接口平均四百多毫秒,偶尔会卡到两秒。文档最后更新在三年前,监控里只有 CPU 和内存。我第一反应是拆服务,后来没敢动。
第一周我只补了慢查询日志,跟了两次线上请求,还找老同事问清楚一个看起来多余的远程校验。真正拖慢请求的是一段不显眼的 N+1,改完后平均耗时降到了 160ms 左右。
事情也没那么漂亮:测试不全,所以灰度拖了两周;那段远程校验最后也没删,只挪到了批处理。
你们接老系统的第一周,是先补文档、补监控,还是直接修最痛的那个问题?
接手时,接口平均四百多毫秒,偶尔会卡到两秒。文档最后更新在三年前,监控里只有 CPU 和内存。我第一反应是拆服务,后来没敢动。
第一周我只补了慢查询日志,跟了两次线上请求,还找老同事问清楚一个看起来多余的远程校验。真正拖慢请求的是一段不显眼的 N+1,改完后平均耗时降到了 160ms 左右。
事情也没那么漂亮:测试不全,所以灰度拖了两周;那段远程校验最后也没删,只挪到了批处理。
你们接老系统的第一周,是先补文档、补监控,还是直接修最痛的那个问题?
我现在会先找一个还能联系上的业务同事。老系统最麻烦的不是代码看不懂,而是没人记得哪些“异常”其实是业务规则。