按照故障现象决定下一步处理动作



服务器状态检查的有效顺序是“先外部、后内部,先基础设施、后业务服务”。单独看到进程正在运行、端口处于监听或主机可以 ping 通,都不能直接证明业务正常,因为服务可能已经卡死、依赖组件异常,或者请求在反向代理和应用层失败。



再次检查服务器状态时,应重复验证外部连接、端口监听、服务进程、资源曲线、应用响应和新增日志。短暂恢复不等于故障结束;如果服务恢复后资源继续上涨、错误日志继续增加或响应时间再次恶化,就需要继续追踪触发条件,而不是仅记录一次“服务已启动”。



从远程可达性判断网络还是主机故障



Linux常用命令:uptime 查看运行时间和负载;top 或 vmstat 1 5 查看CP💎U、内存和等待;free -h 查看内存;df -h 与 df -i 查看容量和inode;ss -s 查看连接概况。



举报/反馈