芜湖合肥高防网站BGP服务器 江西

knight 2022-8-18 182

个别机房有时候会出现大面积风暴式的无故心跳异常,同时网络ping包异常,但上联网络设备ping包正常,这种误报,一般根据具体case具体进行针对性的分析。如根据监控每个机房的上报频率,排除干扰。

进一步识别误报

至此,大部分干扰已经过滤掉,但仍有一部分误报隐藏其中。比如心跳异常,ping异常,都合乎宕机判断的逻辑,会导致误判成宕机,如导致网卡被打爆,或者重试率高,这种是业务原因导致网络异常,但业务认为不是异常,需要排除掉。再例如服务器并没有挂掉,但是IO延时和资源占用率各项指标都不正常等场景。针对以上等情况,增加uptime判断以及带外日志分析排查。

宕机时间点探测uptime确定是否发生重启。

进一步通过分析日志是否连续,判断是否发生重启。

日志重启特征值匹配,确认是否发生重启。

如果还不能确定,使用uptime的时间窗技术进行重启。

仍不能确定的待处理,进入长尾处理名单。


上一篇:福州机房服务器托管 大带宽接入扛大流量攻击 弹性防御上限
下一篇: 666IDC
最新回复 (0)
返回