跳转至

事故处置速查清单

发现与定级

  • 业务影响是什么:用户、区域、租户、功能、数据和收入?
  • 开始时间、当前趋势和爆炸半径1是否明确?
  • 监控是否可信,是否存在遥测2丢失或采样偏差?
  • 是否需要事故指挥3、沟通负责人和专用协作频道?

证据与假设

  • 建立变更时间线:发布、配置、证书、扩缩容、流量、依赖和云事件。
  • 每个假设写明支持证据、反证、下一条低风险验证和截止时间。
  • 保留关键日志、事件、profile4、状态快照和查询结果;不要先清理现场。
  • 同时观察用户路径、服务黄金信号5、依赖和资源饱和度。

止血与恢复

  • 优先选择可逆、局部、可观测的动作;每次只改变一个主要变量。
  • 明确操作人、复核人、目标、超时、成功指标和回滚条件。
  • 流量切换、限流、降级、回滚、扩容和禁用功能都要评估次生影响。
  • 宣布恢复前验证合成交易、真实流量、数据完整性、队列积压和下游状态。

复盘与防复发

  • 区分触发事件、技术根因、促成因素、检测缺口和恢复阻力。
  • 行动项必须有负责人、期限、验收指标和优先级;避免“加强关注”。
  • 同时处理代码、配置、平台守护栏、测试、演练、文档和组织责任边界。
  • 用恢复时间、复发率、告警质量和行动关闭率验证改进是否有效。

  1. 爆炸半径(blast radius)指一次故障或错误变更可能影响的用户、服务、区域和数据范围。 

  2. 遥测(telemetry)是系统自动产生并采集的指标、日志、链路等运行数据。 

  3. 事故指挥机制为响应过程明确总协调者、技术执行、沟通和记录等角色,减少多人无序操作。 

  4. profile(性能剖析数据)按调用栈归集 CPU、内存或阻塞时间,用于定位代码热点。 

  5. 黄金信号通常指延迟、流量、错误和饱和度,是观察服务健康与用户影响的四类核心信号。