事故处置速查清单
发现与定级
- 业务影响是什么:用户、区域、租户、功能、数据和收入?
- 开始时间、当前趋势和爆炸半径是否明确?
- 监控是否可信,是否存在遥测丢失或采样偏差?
- 是否需要事故指挥、沟通负责人和专用协作频道?
证据与假设
- 建立变更时间线:发布、配置、证书、扩缩容、流量、依赖和云事件。
- 每个假设写明支持证据、反证、下一条低风险验证和截止时间。
- 保留关键日志、事件、profile、状态快照和查询结果;不要先清理现场。
- 同时观察用户路径、服务黄金信号、依赖和资源饱和度。
止血与恢复
- 优先选择可逆、局部、可观测的动作;每次只改变一个主要变量。
- 明确操作人、复核人、目标、超时、成功指标和回滚条件。
- 流量切换、限流、降级、回滚、扩容和禁用功能都要评估次生影响。
- 宣布恢复前验证合成交易、真实流量、数据完整性、队列积压和下游状态。
复盘与防复发
- 区分触发事件、技术根因、促成因素、检测缺口和恢复阻力。
- 行动项必须有负责人、期限、验收指标和优先级;避免“加强关注”。
- 同时处理代码、配置、平台守护栏、测试、演练、文档和组织责任边界。
- 用恢复时间、复发率、告警质量和行动关闭率验证改进是否有效。