说真的,机械硬盘(HDD)在备份场景里依旧是性价比之王。单 TB 成本远低于 SSD,写入寿命几乎不用操心,闲置状态下的数据保存稳定性也是固态拍马赶不上的。但很多人在备份时直接套用固态的那套思路,结果踩坑——比如拿 SMR 叠瓦盘做主备份、把桌面盘扔 RAID 里 7×24 跑、用移动硬盘存冷备结果三年没通电……这些破防案例我见过太多次。
机械硬盘的备份策略,得从盘体特性出发重新设计。下面这套方案是我给小型工作室和重度个人用户做归档时一直在用的,把 CMR/PMR 选盘、3-2-1 法则、RAID 级别、轮换策略和监控脚本串成一条线,能落地、能复用。
一、备份盘选型:CMR 是底线,SMR 别碰
机械硬盘按记录方式分 CMR(Conventional Magnetic Recording,传统磁记录)和 SMR(Shingled Magnetic Recording,叠瓦式磁记录)两种。从物理原理上看,SMR 盘把相邻磁道部分重叠写入以提升面密度,代价是写入时需要改写相邻磁道。这意味着 SMR 盘在随机写入时必须先读取再改写整片磁道组,写入速度会出现断崖式下跌(部分场景能从 200MB/s 跌到 5MB/s 以下)。对备份场景是致命伤——你备份的如果是大量小文件、文档、工程素材,写入速度会慢到让你怀疑盘坏了。CMR(也叫 PMR,Perpendicular Magnetic Recording)的磁道之间保留物理间隔,每条磁道独立读写,性能稳定且可预测,这是备份盘必须坚守的底线。这部分技术原理在 Mi&Bee Blog 的机械硬盘选购分析 和 什么值得买的 NAS 硬盘选购指南 里都讲得很细。
自检方法:看盘体型号结尾基本能判断。例如希捷 BarraCuda 3.5 寸桌面盘部分容量(2TB 及以上部分型号)、西数 Blue 部分型号、东芝 P300 部分容量是 SMR;NAS 专用盘(希捷 IronWolf、西数 Red Plus/Pro、东芝 N300)基本都是 CMR。早年间西数 Red 2TB 部分批次也踩过 SMR 雷,选购时务必查官方 spec sheet,不要凭印象下单。
备份盘推荐等级(综合 淘宝世界站的 NAS 硬碟配置攻略 和 Mi&Bee Blog 的分层思路):
第一梯队:NAS 专用 CMR 盘(IronWolf、Red Plus、N300),7×24 设计,震动传感器对多盘机箱友好,工作负载额定通常在厂商规格中标注为百 TB/年级别
第二梯队:企业级盘(希捷 Exos、西数 Ultrastar),性能最强、MTBF 通常达 250 万小时量级、工作负载额定可达 550TB/年(厂商标称),但噪音和功耗也大,价格通常比消费级盘贵出一截,具体看型号与渠道
第三梯队:监控盘(SkyHawk、Purple),适合持续顺序写入(视频流场景),但随机读写和频繁擦写不是其设计目标
备份盘千万别图便宜买桌面盘——CMR 桌面盘越来越少了,而且桌面盘设计负载是 8×5,工作负载额定一般只有 55TB/年上下(厂商标称),拿来 7×24 做备份等于让一个人干三个人的活。
二、3-2-1 法则的 HDD 落地方案
3-2-1 法则:3 份数据、2 种介质、1 份异地。说起来简单,做起来一堆人栽在「异地」两个字上——很多人把第二块盘放在同一个桌面机箱里,这不算异地。同一个房子遇到火灾、洪水、盗窃时整批数据一起挂掉,真正的异地应该是物理距离足够远、物理环境足够独立。这条原则 英方软件 3-2-1 备份规则解读 里也反复强调,并补充了不可变性、验证与灾难恢复编排的演进思路。
实操配置(家庭/小型工作室):
数据 1(生产盘):系统盘或工作盘,日常读写,建议放在主机内置位
数据 2(本地备份):NAS 或外置硬盘柜,RAID 1 镜像,提供本地冗余
数据 3(异地备份):另一块 USB 硬盘,每月轮换带回家或放父母家;或加密上传到云端冷归档(Backblaze B2、阿里云 OSS 冷归档、AWS Glacier 等),距离建议 50 公里以上
HDD 的优势在这里就出来了:冷归档成本低,单盘 8TB、18TB、20TB 的容量现在都常见。云端那块如果走冷归档路线,单价能压到 0.001 美元/GB/月以下,长期持有成本极低。
注意:异地备份的那块盘,每三个月至少通电运行一次,读写一下数据,确认盘体健康。HDD 长期不通电,电机轴承油膜干涸、磁头卡死在停泊区的概率会上升,盘片表面润滑层也会缓慢退化。曾有用户反馈一块放了两年的企业级盘第一次通电就出现大量 Reallocated Sector,就是典型的长期闲置导致的介质退化。
三、RAID 配置:按场景选,别无脑 RAID 5
RAID 不是备份,是冗余。这句强调一万遍都不嫌多。RAID 能解决的是「硬件坏了一块盘数据不丢」,但解决不了「误删除、勒索病毒、文件系统损坏、自然灾害」,这些场景必须靠独立的多版本备份来兜底。3-2-1 原则下 RAID 只是"本地冗余"那一层,不能替代异地备份——这也是 淘宝世界站 NAS 攻略 里反复警告的点。
场景 推荐配置 理由
双盘 NAS 家用 RAID 1 镜像,容量 50%,最简单最稳,重建速度快
4 盘 NAS RAID 5 或 RAID 6 RAID 5 允许坏一块盘,RAID 6 允许坏两块
4 盘以上性能+冗余 RAID 10 先镜像再条带,性能和冗余兼得,但容量 50%
备份专用 单盘 + 独立备份 RAID 重建在备份盘上纯属脱裤子放屁
8 盘以上大容量 RAID 6 或 RAID 60 大容量阵列 URE 风险更高,需要双盘校验
实战坑点:
RAID 5 在大容量盘时代重建失败风险显著上升。Backblaze 长期公开的硬盘故障率报告以及企业级存储厂商的白皮书都反复指出这一点:单盘容量做大后,RAID 5 重建期间遇到 URE(Unrecoverable Read Error,不可恢复读错误)的概率不可忽视。企业级盘 URE 标称通常在 1 in 10^15 bits 量级,消费级盘则在 1 in 10^14 bits。RAID 5 重建时要读完全部剩余盘的全部数据,多盘大容量的组合下总读取 bit 数已经突破 10^14 量级,一旦撞上 URE,RAID 5 就会因校验失败而无法完成重建,整组 RAID 报废
RAID 重建时所有盘同时高负载读写(特别是大文件顺序读取),盘体温度飙升、振动叠加,二次故障概率明显上升。重建一块 16TB 的盘可能需要 24-48 小时,这段时间里剩余盘体的负载压力是日常运行的数倍
备份盘不要组 RAID,单独使用 + 多版本轮换才是正确姿势。备份盘上的 RAID 重建失败案例远比生产盘多,因为备份盘往往是闲置状态下突发读写,盘体润滑、机械磨损等隐性故障都会被放大
四、备份轮换:GFS 方案够用 90% 用户
GFS(Grandfather-Father-Son)即祖父-父-子方案,这是企业级备份的经典轮换策略,个人和小型工作室完全可以平移使用:
每日备份(Son):保留最近 7 天,按日期命名目录,每日增量
每周备份(Father):保留最近 4 周,每周一次全量备份
每月备份(Grandfather):保留最近 12 个月,每月一次全量备份
每年备份(可选):对于长期归档需求,可加一层年度备份,保留 3-7 年
实操上,Linux 下配合 rsync 的 --link-dest 参数可以做到增量但保留完整目录树,未变化的文件通过硬链接复用,磁盘占用极低(每日备份看起来是全量,实际增量部分很小)。Windows 下用 robocopy 的 /MIR 配合版本目录,或者直接用 Veeam Agent for Windows(全量+增量链),效果类似。
如果你数据量小(单次备份 < 500GB),用 FreeFileSync 配任务计划也凑合,但版本管理不如前者精细。需要注意 FreeFileSync 默认会把已删除文件同步删除,开启「回收站」选项或定期归档到独立目录更安全。
进阶方案:对于勒索病毒防护,可以在 GFS 基础上加一份完全离线的「气隙备份」(air-gapped backup)——每月备份完成后断电拔盘,物理隔离。这是当前对抗勒索病毒最有效的手段之一,与 英方软件 3-2-1 演进方案 里强调的"不可变性"思路一致。
五、SMART 监控:装个脚本提前预警
HDD 死之前通常会呻吟。SMART(Self-Monitoring, Analysis, and Reporting Technology)信息能反映绝大部分故障前兆,关键是要学会读懂这些信号而不是等到盘体不识别了才后悔。
关键监控项:
Reallocated Sector Count(ID 05):已重映射扇区数。出现非零值立刻备份并考虑换盘,这个值反映的是磁介质已经开始出现不可靠读写的扇区
Current Pending Sector Count(ID C5):待映射扇区,非零意味着磁头读取异常但还没触发重映射。如果该值随后归零并转移到 05,说明是临时性问题;如果持续增长,说明盘在恶化
Offline Scan UNC errors(ID 198 / 部分厂商自定义):离线扫描发现的不可纠正错误。出现非零基本可以判定盘体已出现严重的物理或逻辑损坏
Spin Retry Count(ID 10):电机启动重试次数,非零说明电机或供电有问题
Temperature(ID 194 / C2):长期高于 50°C 寿命衰减明显,HDD 工作温度每升高 10°C 故障率约提升一倍(Arrhenius 模型)
监控工具:
Linux:smartctl -a /dev/sdX + cron 定时执行,可结合 smartd 守护进程做实时告警
Windows:CrystalDiskInfo 开机自启 + 邮件/微信通知,也可以用 smartmontools 的 Windows 版做脚本化监控
NAS:群晖、威联通自带 SMART 报表,建议每周邮件推送,群晖的「硬盘健康事件」触发时可配置自动通知
阈值建议:05、C5、198 任一项出现非零立即触发告警;Reallocated Sector Count 增速过快(每周翻倍)说明盘在快速恶化,别等了。备份盘上看到的任何 SMART 异常都应该当作生产盘上的异常一样严肃对待——备份盘坏了等于没有备份。
六、工具链实测:rsync / robocopy / FreeFileSync 怎么选
我自己在不同平台都用过,简单说结论:
rsync(Linux/macOS):脚本控首选,--link-dest 做快照式增量无敌,ssh 加密传输天然支持跨主机备份。rsync -avh --progress --delete --link-dest=/backup/yesterday /source/ /backup/today/ 是经典组合
robocopy(Windows):微软自带,/MIR + /Z(可重启模式)+ /MT:8 多线程,实测备份速度比多数第三方工具快一截。robocopy D:\source E:\backup /MIR /Z /MT:8 /R:3 /W:10 是常用配置
FreeFileSync(跨平台 GUI):图形界面,对小白友好,对比/镜像/增量三种模式直观;缺点是大文件多时调度不够灵活,任务计划集成不如命令行工具干净
Duplicati:支持加密+压缩+分块上传到云,适合做云端冷备,自带 Web 管理界面,支持 S3、B2、WebDAV 等多种后端
BorgBackup / Restic:进阶选择,支持客户端加密、块级去重,适合做带版本管理的加密备份
我个人主力方案:Linux 下 rsync + cron,Windows 下 robocopy 写 bat 脚本挂任务计划,GUI 工具留给不熟命令行的同事。
七、备份验证:90% 的人栽在这一步
备份做了不等于能恢复。我见过太多用户「备份跑了半年,发现需要恢复时文件已经损坏」的案例——备份软件默默报错、备份的源盘已经是损坏状态、备份介质出问题但没人检查。这些悲剧的根源都是缺乏备份验证。英方软件 3-2-1 文章 里把"验证"列为现代数据韧性的关键一环,理由和我踩过的坑完全一致。
验证方法:
定期抽检恢复:每季度从备份盘中随机抽 10-20 个文件,恢复到独立位置并校验哈希值(sha256sum 或 certutil -hashfile)
校验和归档:每次备份完成后对备份目录生成校验和文件(manifest),恢复前先验证备份完整性
演练脚本:写一个自动化脚本,模拟一次小规模恢复流程,验证从「发现数据丢失」到「完整恢复」的全链路是否通畅
异地同步测试:每月检查异地备份是否真的同步成功,不要只看客户端显示「成功」就放心
实战建议:备份日志一定要保留并定期人工 review,而不是只在出问题后才去翻日志。日志里藏着大量早期故障信号——某次备份突然变慢、某次出现 I/O error 重试、某次磁盘空间异常增长——这些都是盘体开始出问题的信号。
八、加密与隐私:异地备份必须做的额外一步
异地备份意味着数据离开你的物理控制范围——放父母家的硬盘、被盗的移动硬盘、被黑客攻破的云端账号——任何一种情况都可能导致隐私数据外泄。备份盘加密是必选项,不是可选项。
加密方案选择:
LUKS(Linux):标准的整盘加密方案,配合 dm-crypt 做全盘透明加密,性能损耗 < 5%
BitLocker(Windows):系统自带,TPM 硬件加速下几乎无性能损耗,适合 Windows 用户
VeraCrypt:跨平台开源方案,支持加密卷和整盘加密,适合做移动硬盘加密
age / GPG:文件级加密,适合 rsync 脚本后置加密后再上传云端
注意:加密密钥的管理比加密本身更重要。密钥丢了等于数据丢了,建议使用密码管理器(如 KeePass、Bitwarden)存储恢复密钥,并打印一份纸质副本放在银行保险箱等独立安全位置。
九、能耗与环境影响:长期备份的隐性成本
HDD 备份系统全天候运行的电费容易被低估。一块 8TB NAS 盘空载功耗约 4-8W,满载约 8-10W,一年下来电费约 35-70 元人民币(按 0.6 元/度)。4 盘 NAS 总功耗通常 20-40W,年电费 100-250 元。如果有异地备份的盘在家里也保持 7×24 运行,成本还要叠加。
单盘年电费约 35-70 元 | 4 盘 NAS 年电费约 100-250 元 | 按 0.6 元/度电价估算
节能建议:
利用 NAS 的硬盘休眠功能:闲置 30 分钟后自动停转,待机功耗可降到 1-2W/盘
设置定时上下电:每天仅在备份窗口通电,其他时间断电(适用于外置备份盘)
选择低功耗企业盘:希捷 Exos 系列有空载功耗 < 5W 的型号
写在最后
机械硬盘备份的核心就一句话:别把所有鸡蛋放一个盘里,选对盘体等级 + 做好异地轮换 + 监控 SMART 提前换盘 + 定期验证恢复。HDD 不会突然死,但会慢慢呻吟,听到信号就行动,比任何「高级方案」都管用。
你这套备份方案跑多久了?用的是哪款盘?评论区聊聊你踩过的坑,顺便说说有没有碰上过 URE 把 RAID 5 干翻的惨案。
来源华强北商行 · 数码科技资讯