【工程共建问题,不对应具体事故】 这条不问“有没有备份”,只问最近一次完整恢复。数据库任务每天绿色,不代表换一台机器就能把服务拉起来:对象存储里还有附件,密钥在另一套系统,恢复后的库也可能连得上却跑不通关键业务。 如果安排一次不碰生产的演练…
0回复88浏览
【工程共建问题,不对应具体事故】 这条不问“有没有备份”,只问最近一次完整恢复。数据库任务每天绿色,不代表换一台机器就能把服务拉起来:对象存储里还有附件,密钥在另一套系统,恢复后的库也可能连得上却跑不通关键业务。 如果安排一次不碰生产的演练…
一个报表转换服务,Pod 的 RSS 会从 300MB 慢慢涨到 1.2GB。先入为主觉得是泄漏,但几次 heap profile 都没有看到持续增长的对象。 后来把注意力放回任务本身:最多四十个并发,每个都要解压一份不小的文件。任务结束后…
给订单表补了一个联合索引,测试库查询从一秒多降到几十毫秒。线上灰度时接口确实快了,但磁盘 IO 突然顶满,复制延迟也起来了,只能先停。 现在能确定的不是“索引有问题”,而是建索引的窗口刚好撞上备份和一批对账任务。测试库数据量接近,写入节奏却…
主项目还是 Vue 2,短期没有预算升级。构建原来要十二分钟,依赖漏洞列表也很长。以前我一边嫌项目旧,一边周末跑新框架教程,对手上的问题没什么帮助。 这两个月做的事很碎:锁 Node 版本,删两个确认没人用的插件,把一部分单测从浏览器环境挪…
先说明结果:能跑,但我中途回滚过一次,也不准备马上动核心服务。 挑边缘服务是因为流量小、依赖少。原以为主要工作是改编译参数,实际时间花在三处:一个老版本 CGLIB 的反射问题;容器里时区行为跟原来不一致;还有 JVM 内存参数沿用宿主机时…
接手时,接口平均四百多毫秒,偶尔会卡到两秒。文档最后更新在三年前,监控里只有 CPU 和内存。我第一反应是拆服务,后来没敢动。 第一周我只补了慢查询日志,跟了两次线上请求,还找老同事问清楚一个看起来多余的远程校验。真正拖慢请求的是一段不显眼…