常见故障类型通常包括网络抖动、丢包/高延迟、链路单向不可达、BGP路由异常、宿主机资源瓶颈(CPU/内存/磁盘I/O)、磁盘故障和服务进程崩溃等。
在香港沙田使用的CN2网络上,典型问题是跨境链路波动导致的丢包和高延迟,以及运营商端的路由回收或BGP策略变更引起的路径切换。
另有可能是虚拟化宿主机资源争用、磁盘坏道、文件系统只读、或者关键进程崩溃(如nginx、数据库)导致业务中断。
这类故障在系统日志(/var/log/messages、dmesg)、监控指标(丢包率、RTT、CPU负载、磁盘IOPS)和应用异常日志中会有明确迹象。
排查优先级应按“外部-链路-主机-服务”的顺序快速定位,优先确认是否为大面积或链路侧问题。
先在监控平台查看是否有批量主机或同一交换机/VLAN出现告警,使用ping/traceroute从多点(本地、上游、外网)核实连通性。
若为网络问题,检查交换机端口、链路光模块状态、接口错误计数,以及路由表和BGP邻居状态,使用mtr/traceroute定位路径中断点。
若链路正常则登录主机查看网卡状态(ethtool、ip a)、路由表(ip route)、防火墙规则(iptables/nftables)、以及进程和系统日志,必要时重启网络服务或进程。
快速定位可通过分布式探测、多点mtr以及流量抓包结合路由表对比来完成。
在不同区域(内网、ISP、境外)同时发起mtr或ping,比较不同路径上的丢包点与延迟跳变,以判断是本地交换机、机房出口还是上游骨干问题。
在可疑链路两端做tcpdump抓包,结合SYN/ACK时序、RTO重传信息,定位丢包发生位置;若涉及加密流量,可采样或在应用端记录请求ID。
短期缓解可调整路由优先级、切换至备份出口、开启QoS限速不必要流量或对关键业务走专线/直连;长期应与CN2提供商协商链路质量并做SLA追踪。
监控与告警要覆盖基础资源、网络质量、业务健康、日志异常四大类,并设置分级告警与自动化响应。
推荐监控指标包括:CPU/内存/磁盘使用率、磁盘I/O等待、网络带宽利用率、丢包率、平均RTT、BGP邻居状态、进程存活、应用响应时间与错误率。
阈值应基于历史基线设定,例如:CPU持续95% 5分钟、丢包率大于2%并持续1分钟、RTT突增超过基线+100ms等,配置分级(P1/P2/P3)并触发不同通知渠道。
结合自动化脚本实现常见故障的自动化修复(如重启网卡、重启进程),并定期做告警演练以避免告警疲劳与误报。
应急响应与灾备应覆盖快速切换、数据保护和沟通流程三条主线。
采用多可用区或多机房部署,关键服务做主动-被动或主动-主动的负载均衡,利用健康检查实现故障时自动流量切换。
对数据库与持久化存储做定期快照与异地备份,确认RPO/RTO目标并执行恢复演练,使用增量备份和跨区域复制降低数据丢失风险。
建立详细的应急响应手册(包含联系人、升级路径、回退步骤和对外沟通模板),并与网络提供商(CN2运营方)建立快速工单与专线支持渠道。
