当前位置: 代码网 > 服务器>服务器>Linux > Linux df -h卡住问题的通用排查与解决过程分享

Linux df -h卡住问题的通用排查与解决过程分享

2026年09月03日 Linux 我要评论
问题现象执行 df -h 查看磁盘空间时,命令卡住无响应,无法 ctrl+c 中断(或中断困难)。根本原因系统中挂载了网络文件系统(nfs或cifs/smb),且挂载参数为 hard(硬挂载)。当nf

问题现象

执行 df -h 查看磁盘空间时,命令卡住无响应,无法 ctrl+c 中断(或中断困难)。

根本原因

系统中挂载了网络文件系统(nfs或cifs/smb),且挂载参数为 hard(硬挂载)。

当nfs/cifs服务端(如 192.168.1.100)网络不通或服务异常时,df -h 需要向所有挂载点发起 statfs() 系统调用以获取空间信息,该调用会因等待网络存储响应而陷入不可中断睡眠(d状态),导致命令卡死。

排查步骤

第一步:确认是否存在网络挂载点

cat /proc/mounts | grep -e "nfs|cifs"

预期输出示例

192.168.1.100:/data/share /mnt/nfs nfs4 rw,relatime,vers=4.2,hard,proto=tcp,timeo=600,retrans=2,...
//192.168.1.200/share /mnt/cifs cifs rw,relatime,...
  • 若输出中包含 hard 关键字,说明是硬挂载,属于高风险卡死类型。
  • 若输出为 soft,则通常不会导致 df 卡死(应用程序会快速收到超时错误)。

第二步:精准定位卡住的挂载点(备选方法)

如果 cat /proc/mounts 能正常执行,但无法确定具体是哪个挂载点卡住,

可以使用 strace 追踪:

strace -e trace=statfs df -h 2>&1 | grep -v "enoent"

观察输出停止在哪个路径上,该路径即为问题挂载点。

第三步:检查nfs服务端连通性(辅助确认)

ping -c 3 192.168.1.100
telnet 192.168.1.100 2049   # nfs默认端口,cifs为445

如果ping不通或端口不通,即可确认是服务端失联导致。

解决办法

方案一:懒卸载(首选,立即生效)

umount -l /mnt/nfs
  • -l(lazy umount):立即从文件系统树中剥离该挂载点,实际清理在后台 完成。
  • 执行后 df -h 立刻恢复响应,适用于绝大多数场景。

方案二:强制卸载(当方案一无效时)

umount -f /mnt/nfs
  • -f(force):强制卸载,仅对nfs有效,cifs可能不支持。
  • 如果 umount 命令本身也卡住,按 ctrl+c 中断后尝试方案一。

方案三:杀掉占用进程后卸载

如果卸载时提示 target is busy,先用 fuser 找出占用进程并杀掉:

fuser -mv /mnt/nfs          # 查看哪些进程在访问该目录
kill -9 pid                 # 杀掉所有列出的pid
umount -l /mnt/nfs          # 再次执行懒卸载

方案四:后台异步卸载(终极手段)

如果连 umount -l 都无响应,将其放入后台执行,然后立即使用 df -h

umount -l /mnt/nfs &
df -h                       # 此时大概率已通

预防措施(永久修复)

修改 /etc/fstab 中的挂载参数,避免使用 hard(除非业务有强一致性要求,如oracle rac)。

nfs 推荐挂载参数

192.168.1.100:/data/share /mnt/nfs nfs4 soft,timeo=10,retrans=2,vers=4.2 0 0

cifs/smb 推荐挂载参数

//192.168.1.200/share /mnt/cifs cifs soft,timeo=10,retrans=2,username=xxx,password=xxx 0 0

参数说明:

  • soft:超时后返回错误给应用程序,而非无限重试。
  • timeo=10:超时时间(单位:十分之一秒,即1秒)。
  • retrans=2:超时后重传次数,达到后返回错误。

特殊情况提示

  • 不要直接重启服务器:卡住的进程处于d状态,重启可能导致关机过程卡在等待io阶段,耗时数分钟甚至更长。
  • df -h 卡住时不要反复执行:多次执行只会堆积更多d状态进程,消耗系统内存。
  • 如果业务必须使用 hard(如数据库):改用以下命令监控nfs状态,它们不会触发挂起:
nfsstat -m                     # 查看挂载状态
cat /proc/self/mountstats      # 查看详细统计信息

快速决策流程图

df -h 卡住
    ↓
cat /proc/mounts | grep -e "nfs|cifs"   ← 找出所有网络挂载点
    ↓
umount -l /mnt/nfs                      ← 优先执行懒卸载
    ↓
df -h                                   ← 验证是否恢复
    ↓(如果仍卡)
umount -f /mnt/nfs                      ← 尝试强制卸载
    ↓(如果umount卡住)
umount -l /mnt/nfs & ; df -h            ← 后台卸载,立即查df

如果以上步骤执行后问题仍未解决,

可查看 cat /proc/mounts | grep -e "nfs|cifs" 的完整输出,进一步分析是否有多个挂载点或特殊协议参数导致。

总结

以上为个人经验,希望能给大家一个参考,也希望大家多多支持代码网。

(0)

相关文章:

版权声明:本文内容由互联网用户贡献,该文观点仅代表作者本人。本站仅提供信息存储服务,不拥有所有权,不承担相关法律责任。 如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 2386932994@qq.com 举报,一经查实将立刻删除。

发表评论

验证码:
Copyright © 2017-2026  代码网 保留所有权利. 粤ICP备2024248653号
站长QQ:2386932994 | 联系邮箱:2386932994@qq.com