要快速区分故障类型,先从基础连通性做判断。使用 ping、traceroute(或 tracert)和远程端口检测是第一步。若 cn2香港vps 本机能 ping 通本地网关但无法到达外网,则通常是运营商或上游链路问题;若连本地网关都不通,则很可能是服务器网卡、虚拟网络配置或宿主机问题。
1)从宿主/控制面板确认实例状态;2)在主机上执行 ping 127.0.0.1、ping 本地网关、ping 外部IP;3)使用 traceroute 查看跳数断点;4)对比不同地区或运营商的连通性(可用手机4G或外部监控节点)。
常用命令包括:ifconfig/ ip addr(网卡状态)、route / ip route(路由表)、ping、traceroute、mtr(实时丢包与延迟)、以及 ss/netstat(端口监听)。
若怀疑是上游链路,记录 traceroute 中第一次出现高延迟或丢包的跃点并与运营商沟通;若是宿主机或虚拟网卡问题,及时重启网络服务或联系 VPS 提供商处理。
在紧急情况下,快速恢复服务优先于深度排查。首先在控制面板尝试 重启实例,检查是否为短时内内核或网络驱动异常导致。同一时间,开启外部监控或用另一网络环境确认是否仍然不可达。
1)确认实例监控(CPU/内存/带宽)是否异常;2)使用控制面板 VNC/Serial 连接查看系统日志;3)执行网络重启命令如 systemctl restart network 或 /etc/init.d/network restart;4)若是高防拦截,临时放宽规则或切换策略。
查看系统日志:journalctl -xe、/var/log/messages、/var/log/syslog;查看防火墙规则:iptables -L -n -v 或 nft list ruleset。若为高防设备误拦截,可临时在控制台屏蔽防护规则或使用白名单。
临时重启或放宽规则后需在恢复稳定后做二次验证,记录变更以便回滚;避免在高峰期频繁重启导致更大影响。
定位丢包与延迟需要结合多个工具进行横向验证。mtr 能同时展示延迟与丢包的跳点,tcpdump 用于抓包分析 TCP/UDP 流量异常,ss 或 netstat 用于查看连接状态与重传信息。
1)运行 mtr -rwzbc 100 目标IP 观察哪一跳出现持续丢包或抖动;2)在出现异常的跃点附近抓包:tcpdump -i eth0 host 目标IP -w /tmp/cap.pcap;3)分析抓到的包看是否存在 RST、重传或 ICMP 错误。
mtr、tcpdump、tshark、ss -s(查看 TCP 重传/丢包统计)、ethtool(网卡错误统计)、dmesg(驱动或硬件报错)。网卡错误或 RX/TX 丢包需查看 ethtool -S eth0 输出。
抓包文件较大,建议只在必要时抓取并限制包数;若怀疑是上游问题,抓取本端与网关之间流量并同时在其他节点抓包以对比。
高防设备误判通常表现为大量连接被阻断、部分国家或 AS 的访问集中失败。排查时先判断是基于 IP 黑名单、流量阈值还是行为检测触发。与高防控制台结合防护日志可以快速定位被拦截的规则。
1)登录高防平台查看防护日志与告警时间点;2)根据日志定位触发规则(如 SYN flood、CC、异常连接率);3)对被误拦的 IP 段做临时白名单或降低灵敏度;4)在恢复后调整规则精准度并补充监控。
在服务器侧检查 iptables 或应用层访问日志(如 Nginx/Apache 日志),并在高防平台导出被拦截的流量样本。对于 CDN/高防链路,确认源站健康检查与回源策略是否被误触发。
临时放宽规则须谨慎,避免造成真正的攻击被放行;恢复后应做规则优化,并保留告警与事件记录用于溯源。
排查完毕后必须做好变更记录、故障时间线与根因分析(RCA)。建立标准化的故障单模板、保存抓包文件与日志片段、并将关键检查命令与恢复命令写入运维手册,可以显著缩短下次排查时间。
1)撰写故障事件记录:影响范围、开始/结束时间、根因、临时恢复措施、长期解决方案;2)在监控系统中添加针对性告警(丢包率、跃点异常、流量异常);3)定期演练重启流程与高防策略回退。
保存关键命令输出如 mtr、tcpdump 抓包、系统日志片段与防护平台导出的事件。如果是配置问题,应将正确配置以配置模板形式保存到版本管理系统(如 Git)。
定期与供应商(VPS 提供商/高防服务商)沟通 SLA 与链路健康,设置多线路或备用节点可在上游故障时实现快速切换,减少业务中断时间。