发生事故时如何处理
基本流程
停止扩大影响 → 保留现场 → 判断范围 → 通知 → 隔离或回滚 → 验证恢复 → 复盘
第一反应
- 停止继续运行未经验证的高风险命令。
- 记录当前时间、操作、目标和观察到的症状。
- 判断影响的是单接口、单实例、整站还是数据。
- 呼叫负责人,不隐瞒刚执行的操作。
- 优先恢复安全且已知的版本,不临时发明复杂修复。
常见场景
- 502:检查上游进程、端口、Nginx 日志,不先重装 Nginx。
- 磁盘满:定位增长源并停止增长,不随机删除数据库文件。
- CPU/内存高:保留进程和日志信息,判断峰值、泄漏或死循环。
- SSH 风险:保持当前会话,使用云控制台或备用入口恢复规则。
- 错误删除:立即停止向相关文件系统写入,联系备份/存储负责人。
- 错误迁移:阻止更多写入,评估前滚、回滚和数据恢复。
恢复不等于结束
验证真实用户路径、后台任务和数据一致性;记录分钟级时间线、根因、哪些保护失效、改进项和负责人。复盘针对系统和流程,不以责怪代替改进。