1.
准备与信息收集(第一步,快速把握全局)
目标:收集必要的线路与设备信息,明确故障影响范围。
操作项:1) 确认受影响的目标 IP/域名与时间点;2) 列出本端出口 IP、上游对端出口 IP、BGP Peer、物理接口、所属 VRF;3) 在监控平台取出相关时间段的带宽/丢包/延迟曲线截图;4) 记录最近变更(配置、路由、ACL、防火墙、设备重启、补丁);5) 同步团队:告知业务侧预计影响与临时缓解措施。
2.
基本互通性检查(Ping/Traceroute/MTR)
目标:判断丢包/高延迟是否在本端、互联链路或对端。
步骤:1) 在 Linux 下运行:ping -c 10 -s 1200 -M do <目标IP>(验证 MTU 与丢包);2) traceroute -n -w 2 -q 1 <目标IP> 或 traceroute -T -n <目标IP>(查看 TCP 路径);3) 使用 mtr -r -c 100 <目标IP> 获取丢包/延迟统计;4) 在不同时间/不同出口(办公网、数据中心、云上)重复以上命令以排除本地问题。
3.
逐跳定位与提供证据(关键:保存输出)
目标:找到丢包或异常跳点并保存证据便于上报。
操作:1) 将 traceroute/mtr 的输出保存为文本并截图;2) 在出现丢包的跳点前后分别做 3 次 100 次 ping(记录丢包率、rtt);3) 如果是跨境链路(CN2)常见问题,记录经由台湾节点的跳点 IP 与 AS;4) 若跳点不可达,使用 provider looking glass 或公共镜像(如 bgp.he.net)对该跳点做外部 traceroute 以验证是否为对端问题。
4.
BGP 与路由检查(路由层面常见原因)
目标:确认路由是否被污染、丢失或发生路径变更。
操作命令(设备示例):
- Cisco:show ip bgp summary;show ip bgp <前缀>;show ip route <前缀>;show interfaces
counters;
- Juniper:show bgp summary;show route protocol bgp <前缀>;show interfaces extensive 。
要点:1) 检查 BGP 状态为 Established;2) 确认上游是否收到了你的前缀/你是否收到对端前缀;3) 若有 route flap,开启 BGP debug 前先谨慎;4) 如发现黑洞/社区策略被应用,记录具体 community 与策略并与上游核对。
5.
链路与接口层检查(物理与链路层)
目标:排除接口错误、CRC、丢包、流控、光衰等物理问题。
操作:1) 查看 ifInErrors/ifOutErrors、input/output drops、interface rate(show interfaces counters/ethtool);2) 检查 SFP/光模块是否有告警、光功率是否正常(dBm 指标);3) 临时更换端口或走备用链路进行对比;4) 若设备支持,抓取 ifAlias、port statistics 的时间序列并导出。
6.
MTU 与分段问题排查(常见影响大包的服务)
目标:确认是否存在路径 MTU 问题导致 TCP 探测/大包丢失。
步骤:1) 使用 tracepath <目标IP> 或 ping -M do -s 来确定可达最大包长;例如:ping -M do -s 1472 <目标IP>(若失败,逐步减小 28 字节);2) 在必要时调整本端接口 MTU 或开启 MSS clamping(在防火墙/负载均衡上);3) 若是 provider 侧 MTU 问题,上报并附上 tracepath 与 ping 输出。
7.
抓包与流量分析(tcpdump/tshark,定位协议级问题)
目标:直接观看丢包或重传时的报文行为。
操作示例:1) tcpdump -i eth0 host <目标IP> and tcp -w /tmp/cap.pcap;2) 使用 wireshark 或 tshark -r cap.pcap 过滤 tcp.analysis.retransmission;3) 检查 TCP 三次握手、RST、ICMP unreachable(Fragmentation needed)等报文;4) 抓取设备侧或链路侧的报文以对比是否在某跳就消失。
8.
性能测试(带宽/延迟/抖动,用 iperf3 & ping)
目标:量化链路带宽可用性与抖动,确定是否为拥塞或 QoS 问题。
步骤:1) 在两端部署 iperf3 服务端和客户端:iperf3 -s(服务端),iperf3 -c -P 10 -t 60(并发流);2) 记录带宽、丢包、retrans 值;3) 使用 ping -i 0.2 -s 64 连续测试 1-5 分钟统计抖动;4) 若发现拥塞,检查队列/流量整形/策略路由并与上游沟通 QoS 策略。
9.
上报与升级(如何向 CN2 提供商高效上报)
目标:提供完整证据并推动问题响应。
上报内容清单:1) 受影响目标与影响时间;2) 本端出口 IP、BGP peer、接口名称与设备型号;3) traceroute/mtr/ping 原始输出与截图;4) tcpdump pcap(压缩)、设备接口 counters、BGP show 输出;5) 如果可能,提供同时段的监控图(延迟/丢包/带宽);6) 提出你已尝试的临时缓解方案。
升级建议:先与专线/云服务对接窗口沟通,必要时要求 provider 在边缘或互联节点做端到端抓包与排查。
10.
常见故障与快速应对清单
问题类型与快速响应:
1) 突然大范围丢包:检查是否有流量清洗/黑洞;开启 ACL/防火墙策略排查。
2) 单方向丢包:可能为路由或对端策略,抓包确认 ACK 是否到达。
3) 延迟波动大:排查拥塞/队列和跨境链路带宽突发,调整 QoS 或切换备用链路。
11.
问:如何判断问题是我方机房还是台湾 CN2 侧的问题?
答:先在本端不同出口(机房内部、本地办公室、云端)分别做 traceroute/mtr 与 ping;若本端到上游边缘稳定但边缘到目标开始丢包或不可达,通常是上游或台湾 CN2 侧问题。结合 BGP show(确认 peer 状态与路由是否被接受)和上游的 looking glass 可以进一步确认。
12.
问:需要给 CN2 运营商提供哪些关键证据才能加快定位?
答:提供(1)traceroute/mtr 原始文本;(2)ping 的时间序列与丢包统计;(3)BGP 会话状态与受影响前缀信息;(4)抓包(pcap)片段;(5)接口 counters(错误/丢包/速率)与监控图。越完整的数据能让对方更快定位到具体设备或链路。
13.
问:遇到跨境链路短时抖动,临时缓解有什么建议?
答:可临时采取:1) 切换到备用出口或备份专线;2) 在防火墙/负载均衡上启用 MSS clamping 或降低 MTU;3) 对关键业务做流量限速或优先级(QoS);4) 与服务提供商协商流量绕行或请求排查维护窗口。
来源:企业运维人员必备的台湾cn2入门故障排查流程清单