Ночью посыпались письма от мониторинга: зеркало перешло в degraded.
Ядро десять минут ретраило чтение одного и того же сектора, а потом выкинуло
диск из массива. Характерная связка — medium error и растущий
Reallocated_Sector_Ct.
Current_Pending_Sector 0x0032 100 100 000 Old_age Always - 184
Reallocated_Sector_Ct 0x0033 094 094 010 Pre-fail Always - 312
Offline_Uncorrectable 0x0030 100 100 000 Old_age Offline - 184
Сто восемьдесят четыре ожидающих сектора за трое суток — это не «поживёт ещё». Диск 2019 года, гарантии нет, менять.
Новый диск той же ёмкости встал в тот же лоток. Ресинк зеркала на четыре терабайта занял девять часов при скорости около 130 МБ/с — упирался не в диск, а в фоновые задачи, которые я забыл притормозить.
Вывод на будущее: перед ресинком останавливать ночную задачу с резервными копиями, иначе две тяжёлые операции делят одну шину.
Короткая проверка SMART теперь раз в сутки, длинная — раз в неделю в ночь на воскресенье. Отдельно завёл проверку на рост ожидающих секторов: письмо приходит не по факту отказа, а когда счётчик сдвинулся с нуля.
И главное — проверил, что копии действительно восстанавливаются. Раз в квартал достаю случайный архив и разворачиваю его на отдельный диск. Первый же такой опыт показал, что один каталог не попадал в копию два месяца.