linux无法直接获取目录下文件平均大小,必须用find -type f -printf "%s\n"输出真实逻辑大小,再经awk计算;du因统计磁盘占用且单位不统一,结果失真。
linux 没有内置命令能直接输出“目录下文件的平均大小”,
必须组合 find 和 awk 手动计算;用 du 算出来的不是逻辑大小,而是磁盘占用,结果会严重偏高。
为什么不能用du -sh配合awk提取数字
因为 du -sh 输出格式不固定:
可能返回 1.2k、345m、2.1g,甚至 4.0t,后缀单位混用且无分隔符;awk 很难可靠识别和统一换算。
更糟的是,du 统计的是块对齐后的磁盘占用(比如 1 字节文件占 4kb),不是真实文件大小——这违背“平均文件有多大”的原始语义。
常见错误现象:
- - 对比
stat -c "%s" somefile和du -b somefile,两者数值常差几 kb - - 在 ext4 上块大小为 4096,小文件越多,
du结果越失真 - -
du -sh *还会漏掉隐藏文件(如.git/下的文件)
find -type f -printf "%s\n"是唯一靠谱起点
-type f 确保只处理普通文件,跳过目录、设备文件、socket、符号链接等;-printf "%s\n" 直接输出每个文件的字节数(即 stat 中的 size 字段),不受文件系统块大小影响,是真实逻辑大小。
实操建议:
- 路径含空格或中文?
find原生支持,无需额外转义 - 权限不足时会报错(如
permission denied),但不影响后续文件处理;加2>/dev/null可静默 - 想排除 0 字节文件?在
awk中加条件:if ($1 > 0) { sum += $1; count++ } - 避免用
ls *或for f in *—— 遇到上千文件易崩,且无法处理以-开头的文件名
用awk累加并除以数量
管道后接 awk 是最轻量、最可控的方式,不依赖额外工具,兼容所有 posix shell。
基础命令(字节为单位):
find /path/to/dir -type f -printf "%s\n" | awk '{sum += $1; count++} end {if (count > 0) print sum/count; else print 0}'
转成 mb(二进制 mib,linux 习惯):
find /path/to/dir -type f -printf "%s\n" | awk '{sum += $1; count++} end {if (count > 0) printf "%.1f mb\n", sum/(count*1024*1024); else print "0 mb"}'
注意点:
- 别用
du -h的-h选项——它不接受管道输入,且单位缩写不可靠 - 除法用
1024*1024是 mib;若硬要十进制 mb,改用1000*1000 awk默认浮点运算,无需额外启用-m或bc
容易被忽略的边界情况
大目录下可能有上万文件,find 本身很快,但 awk 内存占用极低(只存两个变量);真正卡住的往往是权限问题或挂载点穿越(比如遇到 /proc 或 nfs 挂载失败)。
如果目标目录包含子挂载点,加 -xdev 限制在同一文件系统内:
find /path/to/dir -xdev -type f -printf "%s\n" | awk '{sum += $1; count++} end {if (count > 0) printf "%.1f mb\n", sum/(count*1024*1024)}'
还有个隐形坑:
某些老旧 shell(如 dash)对管道末尾的 awk 的 end 块处理不稳定,建议明确指定 awk 路径:/usr/bin/awk。
总结
以上为个人经验,希望能给大家一个参考,也希望大家多多支持代码网。
发表评论