Диск отвалился на горячую, а массив выжил

Ночью посыпались письма от мониторинга: зеркало перешло в degraded.

Что показал журнал

Ядро десять минут ретраило чтение одного и того же сектора, а потом выкинуло диск из массива. Характерная связка — medium error и растущий Reallocated_Sector_Ct.

Current_Pending_Sector   0x0032   100   100   000   Old_age   Always   -   184
Reallocated_Sector_Ct    0x0033   094   094   010   Pre-fail  Always   -   312
Offline_Uncorrectable    0x0030   100   100   000   Old_age   Offline  -   184

Сто восемьдесят четыре ожидающих сектора за трое суток — это не «поживёт ещё». Диск 2019 года, гарантии нет, менять.

Замена и ресинк

Новый диск той же ёмкости встал в тот же лоток. Ресинк зеркала на четыре терабайта занял девять часов при скорости около 130 МБ/с — упирался не в диск, а в фоновые задачи, которые я забыл притормозить.

Вывод на будущее: перед ресинком останавливать ночную задачу с резервными копиями, иначе две тяжёлые операции делят одну шину.

Что поменял после

Короткая проверка SMART теперь раз в сутки, длинная — раз в неделю в ночь на воскресенье. Отдельно завёл проверку на рост ожидающих секторов: письмо приходит не по факту отказа, а когда счётчик сдвинулся с нуля.

И главное — проверил, что копии действительно восстанавливаются. Раз в квартал достаю случайный архив и разворачиваю его на отдельный диск. Первый же такой опыт показал, что один каталог не попадал в копию два месяца.