宁波衢州网站BGP服务器租用 山西 内蒙

knight 2022-7-21 118

特殊情况干扰排除

个别机房有时候会出现大面积风暴式的无故心跳异常,同时网络ping包异常,但上联网络设备ping包正常,这种误报,一般根据具体case具体进行针对性的分析。如根据监控每个机房的上报频率,排除干扰。

进一步识别误报

至此,大部分干扰已经过滤掉,但仍有一部分误报隐藏其中。比如心跳异常,ping异常,都合乎宕机判断的逻辑,会导致误判成宕机,如导致网卡被打爆,或者重试率高,这种是业务原因导致网络异常,但业务认为不是异常,需要排除掉。再例如服务器并没有挂掉,但是IO延时和资源占用率各项指标都不正常等场景。针对以上等情况,增加uptime判断以及带外日志分析排查。

宕机时间点探测uptime确定是否发生重启。

进一步通过分析日志是否连续,判断是否发生重启。

日志重启特征值匹配,确认是否发生重启。

如果还不能确定,使用uptime的时间窗技术进行重启。

仍不能确定的待处理,进入长尾处理名单。

长尾再次处理

未确认的待处理的,会加入到长尾列表中,像这种分钟级的心跳异常


上一篇:宁波衢州高防BGP服务器租用托管
下一篇:大带宽服务器租用推荐666IDC高防服务器
最新回复 (0)
返回