云服务器监控告警该配哪几条:从能发现问题到不被噪声淹没
监控的失败方式有两种:一种是关键指标没配告警,出事没人知道;另一种是配了太多告警,真正的问题被埋在噪声里。多数团队会先经历第一种,然后过度纠正成第二种。
先配这几条就够用
一套最小可用的基线,覆盖的是"会导致服务不可用"的情况,而不是所有可观测的指标。
磁盘使用率是第一条,也是最该优先配的。磁盘写满会让服务、数据库、日志同时出问题,而且恢复过程往往比预防麻烦得多。阈值不要设得太靠后,留出足够的处理时间。
内存使用率是第二条。内存耗尽会触发进程被强制终止,表现为服务莫名重启。这类故障如果没有告警,很容易被当作偶发问题忽略。
CPU 使用率是第三条,但要注意它的意义。短时间高负载是正常的,持续高负载才是问题,所以判断依据应当是持续时长而不是瞬时值。
服务可用性是第四条,也是最贴近用户感受的一条。从外部对关键接口做周期性探测,检查返回是否正常。这一条能发现前面几条都发现不了的问题,比如进程活着但依赖挂了。
两条经常被漏掉但很重要的告警
第一是定时任务的执行结果。定时任务失败通常是静默的:脚本报错、依赖不可用、权限变更,都不会主动通知任何人。等到需要用它的产出时才发现已经好几天没跑成功。
处理方式是让任务在成功时留下可被检查的痕迹,对超过预期时间没有成功痕迹的情况告警。备份任务尤其需要这一条——没有验证过的备份和没有备份的差别不大。
第二是证书到期。证书过期造成的是全站不可访问,而且通常在非工作时间发生。要检查的是线上实际提供的证书剩余天数,而不是本地文件的有效期。文件更新了但服务没重载,从外部看仍是旧证书。
阈值按高分位设定而不是均值
用平均值设阈值容易漏掉真实问题。一个白天空闲、晚上跑满的服务,平均使用率可能很低,但晚上的体验已经很差。
更合适的做法是看高分位数据。如果高分位的使用率已经接近上限,说明相当比例的时间处于紧张状态,即使平均值看起来健康。
同时要给阈值配上持续时长条件。"使用率超过阈值并持续若干分钟"比"瞬时超过阈值"有用得多,前者过滤掉了正常波动,后者会持续产生噪声。
控制告警数量比增加告警更难
告警疲劳是真实存在的失效模式。当一个人每天收到几十条告警,其中大部分不需要处理时,他会开始忽略全部告警,包括重要的那些。
几个有效的收敛手段:给告警分级,只让确实需要立刻处理的走即时通知渠道,其余进汇总;对同一问题的重复告警做合并,避免一个故障引发几十条通知;给已知的、暂时无法处理的问题设置抑制期,而不是让它每小时提醒一次。
一个判断标准是:如果一条告警连续多次触发但每次都不需要采取行动,那它的阈值设错了,或者它不该是告警。要么调整,要么关掉,不要留着。
告警要说清该做什么
只写"CPU 使用率过高"的告警,收到的人还需要自己判断严重程度、影响范围和处理方式。在紧急情况下,这些判断都是额外耗时。
好的告警内容包含三件事:哪个资源出了什么问题、影响是什么、第一步该做什么。即使只是一句"检查是否有异常进程占用",也比没有指引好。
定期回顾比一次配好更重要
告警配置会随着环境变化而失效:机器换了、服务迁了、阈值不再合适、某些告警对应的资源已经不存在。
建议每隔一段时间回顾三件事:过去这段时间有没有故障是告警没覆盖到的,说明基线需要补;有没有告警反复触发但从不需要处理,说明需要调整或删除;有没有告警指向的资源已经不存在,说明配置需要清理。
这个回顾不需要频繁做,但它决定了监控体系是在变好还是在腐化。
备份类任务的告警怎么配
备份是最需要告警却最常缺少告警的一类任务,因为它失败时没有任何人受影响,直到需要恢复的那天。
可行的做法是让备份任务在成功后留下可检查的痕迹,比如写一条带时间戳的成功记录,或者产出一个带日期的文件。然后由另一个检查动作判断:预期时间内有没有出现新的成功痕迹。超过预期时间没有,就告警。
比只检查任务是否报错更进一步的,是检查产出是否合理。备份文件存在但大小异常偏小,说明导出过程出了问题而没有报错。可以在任务里加一层校验,比如确认压缩包能正常解开、确认内容包含预期数量的数据表,任一项不满足就视为失败。
这套机制的价值在于把"备份失败"从静默变成可感知。没有验证的备份和没有备份,在真正需要的时候差别不大。
告警之外还需要留存趋势
告警负责在越过阈值时通知,但很多问题在越过阈值之前就有迹象。
值得长期留存并偶尔回看的有几项:磁盘使用率的增长斜率,它能推算出还有多久会满;内存使用的基线是否在缓慢上移,这通常是内存泄漏的征兆;响应时间的高分位数据是否在逐步变差,用户往往在告警触发之前就已经有感受。
这类观察不需要天天做。每隔一段时间看一次趋势图,就能发现那些不会触发告警但确实在恶化的问题,从而在它变成故障之前处理掉。
区别在于:告警处理的是已经发生的问题,趋势观察处理的是即将发生的问题。前者是必需的,后者决定了运维是被动还是主动。
腾讯云国际和阿里云国际商品当前开放;AWS 与 Google Cloud 商品目前未开放,本文不提供相关导流。可用监控指标、告警渠道与配额均以对应国际站控制台实时信息为准。
官方来源
常见问题
云服务器监控告警该配哪几条需要注意什么?
操作前先确认账号属于国际云对应站点,并备份关键数据或记录当前配置。按本文步骤完成后做一次验证。需要账号可申请账号,续费见自助充值。
出错后如何快速回滚或止损?
优先恢复到变更前的快照、镜像或原规则;若涉及计费或销毁类操作,先停止继续变更,再按官方控制台状态与工单路径处理。不确定时不要反复点击高危按钮。
没有对应云账号时怎么开始?
可先通过申请账号开通国际云账号,再用自助充值完成额度准备。新账号建议先完成 MFA、访问密钥收敛与费用告警,再部署业务。