首先通过 ping、traceroute 和外部监控查看连通性,确认是本地到机房的链路中断还是机房出口问题。若多个独立站点或监控告警同时失联,通常指向 网络中断。
1. 使用 ping 对服务器公网IP 和机房网关测试延迟与丢包。
2. 使用 traceroute(或 tracert)定位跳数中断位置,判断是ISP还是骨干链路问题。
3. 登录机房管理面板或询问机房运营商(NOC)查看链路状态公告及维护计划。
短期内可切换备用线路或启用BGP多线;若为外部ISP问题,联系运营商并提供 traceroute 与 RTT 日志协助定位。
DNS解析异常通常表现为域名无法解析或解析到错误IP。先确认域名解析记录、TTL 与 DNS 服务器的状态。
1. 使用 nslookup 或 dig 测试 A/AAAA/CNAME/NS 记录,验证解析是否一致。
2. 检查域名注册商与 DNS 托管平台是否有配置改动或过期。
3. 验证 DNS 服务器是否遭受 DDoS 或缓存中毒,可切换到可信的公共解析(例如 8.8.8.8)以排查本地解析问题。
若记录错误或被篡改,立即恢复正确记录并降低 TTL 以加速传播;必要时启用二级 DNS 或 DNS Failover 服务确保高可用。
通过监控告警(SMART、IPMI、BMC)与日志可以快速识别硬盘坏道、内存 ECC 报错或 CPU 温度异常等硬件问题。
1. 检查服务商提供的硬件监控(如 IPMI/iLO/DRAC)报警信息。
2. 对硬盘运行 SMART 检测(smartctl),定位坏道或预警。
3. 使用内存检测工具(memtest86)或查看系统日志中的 ECC 报文。
若有 RAID 或热备节点,优先将故障节点下线并由冗余阵列重建;无冗余时尽快从备份恢复至替换硬件,并记录故障时间与日志提交给机房工程师。
检查系统负载、内存/交换分区使用、进程列表与端口占用可以快速定位问题来源,结合日志(/var/log、应用日志)恢复服务。
1. 使用 top、htop、free、vmstat 检查 CPU 与内存使用状况。
2. 使用 ss 或 netstat 查看端口占用与连接数量,确认是否为流量激增导致。
3. 查看应用日志与系统日志(journalctl、/var/log)定位异常堆栈或 OOM killer 信息。
短期可重启单个服务进程或清理缓存、释放句柄;对于频繁 OOM,应调整内存分配、增加 swap 或水平扩展服务实例并启用进程守护(systemd、supervisor)。
预先制定冗余与备份策略是关键,断电应优先执行切换计划并确保数据一致性。
1. 确认机房 UPS 与发电机状态,联系机房 NOC 获取恢复时间预估。
2. 启用异地备份或冷/热备机房的故障切换(DNS Failover、负载均衡或 CDN 缓存)。
3. 如需强制断电下机,优先做数据一致性快照或备份,然后安全下机并记录变更。
实施多可用区部署、定期演练故障切换流程并保持离线备份,确保在机房断电或机柜损坏时可以快速将流量切换到备用节点。