本文从运维实战角度出发,提炼出在对香港CN2链路进行测评与长期监控时最实用的指标、采集方法与工具组合,覆盖网络层、传输层和主机层的关键项,并给出采样频率、阈值建议与探针部署位置,便于快速构建可观测平台、定位问题与评估链路质量。
评估链路质量必须优先关注延迟、丢包、抖动(延迟方差)、带宽吞吐、路由跳数与BGP可达性等指标。延迟通常用ICMP或TCP RTT表示,丢包率需要在不同时间窗口(例如1m/5m/1h)统计,抖动适用于实时业务(语音/视频)。此外,链路利用率、连接超时率与TCP重传也能反映拥塞与链路不稳定。
主动探测与被动监控结合是最稳妥的做法:主动用ping、mtr、iperf等工具做定时探测,设置不同的包大小和频率以覆盖典型业务;被动则在服务端收集TCP RTT、重传和应用层请求耗时。延迟建议同时采集ICMP/TCP/应用层三类数据,丢包需在多个时间窗口取样,抖动可用两点间延时差计算。
探针应部署在用户侧出口(例如香港的边缘机房)、中间交换节点以及目标服务的接入层,形成至少三个分布点:近端(国内或源站)、香港CN2出口和目的端(目标云或ISP机房)。跨ASN和跨可用区的探针能揭示路由切换与BGP问题。对于在机房内部测评,还应在内网核心交换与出口防火墙两侧各放探针。
主动检测(例如定时ipERF、ping)优点是可控、可复现并能模拟不同流量特征;缺点是会产生额外流量且可能无法覆盖真实用户路径。被动监控则直接反映真实业务表现(如应用延迟、错误率),有助于捕捉 Sporadic 问题。两者结合能在主动发现异常后,用被动数据确认影响范围与用户体验。
推荐组合:用Prometheus + Grafana做时序指标与可视化,搭配node_exporter与网络exporter采集主机与接口数据;用Zabbix或Alertmanager承载告警策略;用Smokeping或fping进行长时序延迟/丢包趋势监测;用iperf3做吞吐基准测试,用mtr做路径与丢包定位,用tcpdump/pcap辅助抓包分析。日常监控由Prometheus/Grafana负责,深度测评按需触发iperf/mtr与抓包。
阈值应结合历史基线与业务SLA:例如高优先级业务目标延迟<100ms、丢包<0.5%、抖动<30ms。告警分层:短时严重(如5m内丢包>2%)触发紧急告警并派单,长期劣化(1h平均延迟上升20%)触发性能审查。告警应包含上下文(最近一小时曲线、探针位置、最近路由变动)并自动关联相关日志与抓包文件,减少人工判断时间。
常用命令:ping -c 60(持续1分钟做统计)、mtr -r -c 100(100次报告路径与丢包)、iperf3 -c <目标> -t 60(60秒吞吐)、tcpdump -w capture.pcap(抓包)。采样频率:关键业务接口1分钟级采样,次要接口5分钟,历史汇总按1小时/24小时压缩存储。长期趋势保留90天以上以便分析季节性波动。
香港CN2路径的稳定性往往受BGP策略影响,路由更改会导致跳数、延迟和丢包瞬时波动。定期记录路由表、AS路径和中间跳数有助于将性能退化与路由变化关联,遇到网络波动时先检查BGP邻居状态与AS_PATH变动常能快速定位问题源。
发生异常时,先从主动探针看延迟/丢包时间线,再比对被动业务指标(连接错误、重试率)。使用mtr追踪可定位发生丢包的具体跳点,若怀疑链路拥塞用iperf做带宽压测复现,结合tcpdump抓包分析TCP三次握手与重传信息。保持统一的时间轴与标签(探针位置、ASN、线路ID)是快速定位的关键。
