
本文为运维与安全团队提供一套可落地的应急处置思路,帮助在业务突发被阻断时快速定位问题根源、恢复访问并安全地复现流量。内容覆盖优先级判断、日志与指标采集、常见误判点、如何利用日志导出与工具进行流量回放,以及在不影响线上业务的前提下进行验证的策略。
在发现业务访问异常或监控告警后,理想的初步诊断窗口为5–15分钟。首先确认是否为全站还是部分路径受影响,快速调用健康检查与后端实例监控,观察SLB、ECS、应用日志与阿里云WAF的实时告警。若短时间内能确定为WAF拦截事件,应优先切换到白名单策略或临时降低防护等级以恢复业务,而后进入详细排查流程。
优先级顺序建议为:1) WAF控制台与告警(拦截策略、规则命中统计);2) WAF访问日志与拦截日志(时间、客户端IP、URI、规则ID);3) SLS/云监控的流量曲线与错误码分布;4) 应用层日志(nginx/access/error)与后端错误率。若WAF日志显示大批量命中同一规则或IP被整网拉黑,说明存在拉黑洞风险,此时不要先大量修改规则,应先导出证据并开启临时放行策略。
排查步骤可按序执行:1) 在WAF控制台查看最近的“攻击日志/事件”,筛选时间段与异常来源;2) 结合源IP与UA在SLS中检索完整请求行,确认是否为合法请求或携带异常参数;3) 检查是否近期下发了新策略、规则或策略组变更;4) 与部署变更(发布、白名单/黑名单变更、流量清洗策略)时间线对齐;5) 若规则ID明确,查阅规则描述与正则,判断是否可通过调整阈值或添加条件的方式精准放行。整个过程要保留原始日志记录,避免盲目撤销规则。
安全回放的关键在于隔离与脱敏。常用做法:从WAF或SLS导出拦截/访问日志(包含请求URL、Header、Body),将敏感信息(Cookie、Authorization、个人数据)脱敏或替换;在内网搭建隔离环境(隔离的ECS或测试域名),并配置仅允许内网访问的后端;使用代理或流量重放工具(例如 goreplay、mitmproxy 或 tcpreplay,按需选择HTTP或二进制流量工具)将请求重放到测试环境。确保测试环境的WAF策略与线上一致,或在复现时对比启用/禁用策略效果。
误判通常源自规则过于宽泛、阈值设置过低、或业务请求模式发生变化。常见场景包括:新发布的API携带大量短请求或特殊Header触发速率限制;第三方爬虫或合法批量任务被视为攻击;URL或参数中包含类似SQL注入或XSS的特征;自动化部署或健康检查被误识为异常流量。另一个风险是攻击者利用规则链路制造大量触发,导致WAF在保护态势下把合法流量“拉黑洞”。因此规则管理需结合白名单、速率限制与行为分析,避免单点过度拦截。
推荐的实操步骤:一、导出日志:在SLS或WAF控制台导出目标时间窗口的完整请求记录;二、脱敏与筛选:对敏感字段脱敏,按IP或URI筛选符合复现场景的请求集合;三、构建回放包:将请求转换为回放格式(HTTP请求文件或goreplay支持的格式);四、搭建隔离环境:准备独立域名或IP,确保不影响线上;五、回放执行:使用工具按原始速率回放(先低速试验再逐步放大),记录响应与WAF日志对比;六、比对与归档:核对回放时的规则命中情况,截取证据(日志、rule id、时间线),作为后续规则优化依据。回放完成后,清理测试数据,确认无遗留放行策略。
最快的缓解通常是基于粒度的临时放行:对确认的合法源IP或IP段添加白名单,或对特定安全策略设置例外(例如对特定URI关闭某条规则)。如果无法精确识别来源,可启用流量分流到备用集群或降级策略(比如限流而非全拦截)。切记记录变更并制定回滚点,避免长期依赖临时例外。最终应在回放与复现后,通过调整规则精确度与引入行为验证来去除临时放行。