文档产品文档

预警与阈值配置说明

预警让问题在扩大前被看到。本文说明预警类型、阈值设定方法、分级策略与避免告警疲劳的做法。

百华产品团队2026-08-24阅读 126有用 21

模块定位

预警功能在指标偏离正常范围时主动通知,让问题在造成损失前被发现。

预警的核心价值是"提前"

预警类型

类型 示例 数据来源
进度预警 工单可能延期 报工进度
质量预警 不良率超标 检验数据
设备预警 故障、OEE 下降 采集数据
物料预警 库存不足、呆滞 库存数据
计划预警 产能超负荷 排程结果
异常预警 数据异常、停机超时 各类

阈值设定方法

方法一:基于标准值

有明确标准的指标:

指标 阈值
合格率 < 95% 预警
OEE < 60% 预警
交期达成率 < 90% 预警

标准来自企业目标或行业惯例。

方法二:基于历史数据

用历史数据的统计特征设定:

  • 均值 ± 2 倍标准差
  • 或历史分位数(比如超过历史 90% 分位)

这种方法更贴合实际,尤其适合波动较大的指标。

方法三:基于趋势

不只看当前值,还看变化趋势:

  • 连续 N 个周期下降 → 预警
  • 与上期相比变化超过 X% → 预警

趋势预警能发现"还没超标但在恶化"的情况,比绝对值预警更早。

阈值设定的常见错误

错误 后果
阈值太松 起不到预警作用
阈值太紧 天天告警,用户忽略
一刀切 不同产品/设备用同一阈值不合理
从不调整 业务变化后阈值失效

阈值要定期回顾调整。建议每季度看一次告警的准确率(告警中有多少是真问题)。

分级策略

预警分级,不同级别走不同通知渠道:

级别 定义 通知方式 响应要求
提示 需关注 站内消息 日常处理
警告 需尽快处理 企微/钉钉 当班处理
严重 立即处理 短信 + 企微 15 分钟内
紧急 可能停线 电话 立即

分级能避免"所有告警都一样急",让用户知道该先处理哪个。

避免告警疲劳

这是预警系统最大的失败模式:告警太多,用户开始忽略

措施

措施 说明
聚合 同类告警合并成一条
抑制 同一问题未处理前不重复告警
频率限制 每小时最多 N 条
分级 只把高级别推到短信/电话
定期清理 取消长期无人响应的告警规则
准确率监控 统计误报率,优化阈值

"定期清理"很重要:一条长期被忽略的告警规则应该被取消,而不是留着占位。

误报的处理

误报是告警疲劳的主要来源。发现误报要:

  1. 分析原因(阈值不合理?数据问题?)
  2. 调整阈值或规则
  3. 记录调整原因

不要把误报当成"正常现象"忍受。每一次误报都在消耗用户对系统的信任。

告警的闭环

告警发出后要有处理流程:

告警 → 通知 → 确认 → 处理 → 记录 → 关闭

环节 要求
确认 接收人确认收到
处理 记录处理措施
关闭 记录处理结果

"确认"环节很重要:能区分"没看到"和"看到了没处理"。

"处理记录"是改善的依据:长期看,哪类告警处理最多、处理措施是什么,能反映管理的薄弱环节。

关键配置项

配置 说明
告警规则 指标、条件、阈值
分级 各级别的阈值和通知方式
接收人 按角色/岗位
频率限制 防骚扰参数
告警时段 是否全天告警

常见问题

问题 原因与处理
告警太多 调高阈值、加聚合和抑制
该告警的没告警 检查阈值和触发条件
告警没人处理 加确认机制、明确责任人、设升级
阈值不合理 基于历史数据重新设定

设计建议

  1. 先少量、再扩展:先配最关键的 5-10 条告警,跑顺了再加
  2. 每条告警都要有明确责任人:没人负责的告警不如不配
  3. 告警内容要可操作:告诉接收人该做什么
  4. 每月回顾:看告警数量、处理率、误报率
  5. 阈值要有依据:不要凭感觉设定

"告警质量比数量重要"。十条准确的告警,胜过一百条噪声。

预警规则的配置方式与分级策略,[待补充:产品团队补齐]。

这篇内容对你有帮助吗?

当前为游客态,投票按设备去重