Планирование восстановления RAID-массива следует начинать еще до выхода из строя одного из дисков. Главный вопрос заключается в том, как долго предприятие сможет безопасно работать в режиме пониженной производительности, когда приложения, контроллеры, диски и персонал находятся под нагрузкой.
Что следует учесть при планировании восстановления RAID-массива до того, как выйдет из строя один из дисков?
Задайте уровень RAID, ширину массива, емкость дисков и профиль рабочей нагрузки.
Начните с уровня RAID, количества дисков, емкости дисков, типа носителя, контроллера, рабочей нагрузки и целевого объекта обслуживания. Группа RAID 6 из 12 дисков объемом 20 ТБ. Жёсткие диски имеет другой диапазон экспозиции по сравнению с небольшим набором зеркал или пулом SSD.
Проверьте состояние дисков, статус резервного копирования, оповещения и готовность резервного накопителя.
Перед сбоем необходимо подтвердить исправность дисков, возможность восстановления резервных копий, маршрутизацию оповещений, наличие запасных частей и полномочия на замену. Восстановление — это не резервное копирование. Компания Huaying Hengtong оказывает поддержку в анализе потребностей, технической проверке, выборе оборудования, внедрении сети, обеспечении качества, эксплуатации и техническом обслуживании, а также сервисной поддержке. В планировании корпоративных серверов и систем хранения данных эти возможности могут быть представлены как поддержка в организации требований, проверке данных на уровне отдельных компонентов, координации полной конфигурации и проверке поставляемой системы до возникновения аварийной ситуации. Наша поддержка основана на фактических данных, а не на гарантии совместимости.
Установите максимально допустимый диапазон ухудшения качества до возникновения сбоя.
Определите максимальное время, в течение которого массив может оставаться в нерабочем состоянии, прежде чем риск станет неприемлемым. Эта цель определяет приоритет восстановления, политику резервирования, численность персонала и правила эскалации. Удаленный холодный резерв может работать слишком медленно, даже если уровень RAID является отказоустойчивым.
Сколько времени на самом деле займет восстановление RAID-массива?
Оцените время восстановления RAID-массива на основе емкости дисков и эффективной пропускной способности.
Практическая оценка рассчитывается как отношение емкости диска к эффективной пропускной способности восстановления, а не к скорости метки. Для корпоративных дисков объемом 8 ТБ, 12 ТБ, 16 ТБ, 20 ТБ или 24 ТБ время восстановления может значительно увеличиться, если операции ввода-вывода хоста остаются активными. ST8000NM017B 8TB корпоративный жесткий диск На странице указан класс привода, но для планирования по-прежнему необходимо измерять пропускную способность контроллера.
Почему реальное время восстановления RAID-массива превышает максимально оптимальную оценку?
Реальное время восстановления увеличивается, когда операции ввода-вывода хоста конкурируют за доступ к диску, приоритет контроллера низкий, в оставшихся дисках присутствуют слабые сектора, выполняются фоновые проверки или массив включает в себя множество элементов. Рассматривайте наилучшую оценку как минимальную.
Как жесткие диски, твердотельные накопители и накопители большой емкости влияют на время восстановления?
Восстановление жестких дисков может сопровождаться проблемами с поиском и длительным сканированием. Восстановление SSD-накопителей может быть быстрее, но все равно расходует ресурсы контроллера, PCIe, теплоотвод и ресурс работы. Большие накопители уменьшают количество отсеков, но увеличивают время простоя, если пропускная способность не масштабируется.

Как уровень RAID влияет на риск восстановления?
RAID 5 против RAID 6: что происходит с отказоустойчивостью во время восстановления?
После выхода из строя одного диска в RAID 5 массив теряет устойчивость к ошибкам четности. RAID 6 обычно сохраняет дополнительный запас прочности на случай отказа, но при восстановлении массива по-прежнему активно используются данные с оставшихся дисков. Диски большей емкости увеличивают период, в течение которого второй отказ может иметь значение.
RAID 10 против RAID с контролем четности: чем отличается рабочая нагрузка по восстановлению?
В RAID 10 обычно восстановление происходит с помощью зеркального партнера, поэтому меньшее количество дисков может нести нагрузку по восстановлению. В RAID с контролем четности восстанавливаются отсутствующие данные по всей группе, что создает более широкое давление чтения. Наилучший выбор зависит от емкости, характера записи, целевого объекта восстановления и конструкции домена отказа.
RAID 50 и RAID 60: почему важны ширина массива и домены отказоустойчивости?
RAID 50 и RAID 60 разделяют емкость на группы четности. Одна и та же общая емкость может нести разный риск, если размер группы и домены отказа различаются. Более узкие группы затрагивают меньшее количество дисков во время одного восстановления; более широкие группы увеличивают полезную емкость, но расширяют зону риска.
Как планирование восстановления RAID-массива защищает производительность приложений?
Сбалансируйте приоритет перестройки приложения с учетом задержки и пропускной способности приложения.
Более высокий приоритет восстановления может быстрее восстановить избыточность, но при этом увеличить задержку и глубину очереди. Более низкий приоритет защищает производительность в производственной среде, но увеличивает период снижения производительности. Используйте метрики в реальном времени, а не привычки.
Какую нагрузку следует уменьшить во время восстановления RAID-массива?
Отложите задания резервного копирования, пакетные операции с базами данных, миграцию виртуальных машин, восстановление репликации, большие последовательные операции записи, проверку данных и некритичные аналитические операции, если они конкурируют с трафиком восстановления. Удалите избыточную нагрузку до восстановления резервирования.
Какие показатели должны запускать механизм ограничения скорости восстановления или эскалации проблем?
Отслеживайте ход восстановления, пропускную способность, задержку приложения, глубину очереди, температуру диска, ошибки носителя, прогнозные оповещения и предупреждения контроллера. Также доступно другое приложение. Руководство по производительности жестких дисков для предприятий Можно задать параметры поведения водителя, но в руководстве по эксплуатации следует использовать пороговые значения параметров местности.
Как следует планировать резервирование и замену жестких дисков в режиме «горячего резерва»?
Выделенный или глобальный резервный сервер: что лучше подходит для RAID-массива?
Выделенный резервный диск защищает один массив и прост в управлении. Глобальный резервный диск может обслуживать несколько массивов, если пулы используют один и тот же тип дисков и целевой объект обслуживания. Выбор параметров осуществляется по важности массива, количеству дисков, емкости, интерфейсу, времени выполнения замены и безопасности автоматического восстановления.
Сколько резервных RAID-массивов следует включить в план восстановления RAID-массива?
Для небольшого массива может быть достаточно одного исправного запасного диска. Для нескольких массивов, крупных накопителей, удаленных объектов или длительных сроков закупки планируйте запасные диски по областям отказов и семействам накопителей. Учитывайте время пополнения запасов.
Каким должно быть условие совместимости, прежде чем запасной диск сможет быть подключен к RAID-массиву?
Емкость — это только первый фильтр. Проверьте полезную емкость, интерфейс SAS/SATA/NVMe, формат сектора, тип лотка, соответствие требованиям прошивки, поддержку контроллера, объединительную плату и путь к слоту. Руководство по замене совместимых корпоративных жестких дисков Это важно, потому что несовместимая запасная часть не сокращает период ухудшения характеристик.
Горячий резерв против холодного резерва: когда лучше использовать мгновенное автоматическое восстановление?
Использование резервных копий без участия оператора сокращает время простоя и время на восстановление. Использование резервных копий позволяет операторам контролировать время восстановления, проверять микропрограммное обеспечение и снижать рабочую нагрузку. Автоматическое восстановление подходит для удаленных или мало укомплектованных персоналом площадок; ручное подтверждение может соответствовать жестко контролируемым производственным окнам.

Что должно включать в себя руководство по восстановлению RAID-массива до, во время и после сбоя?
Перед сбоем: запишите базовые параметры массива и подтвердите готовность к восстановлению.
Записывайте состояние массива, микропрограмму контроллера, инвентаризацию дисков, наличие запасных частей, проверку резервного копирования, контакты, ожидаемое время восстановления и ответственных за эскалацию проблем. Компания Huaying Hengtong представляет бренды Dell, HP, Super Fusion, IBM, Lenovo, Huawei, Inspur и другие, а ассортимент ее продукции включает ПК, серверы, коммутаторы, аксессуары, рабочие станции, системы хранения данных и другое аппаратное и программное обеспечение.
В процессе восстановления: проверьте правильность используемого накопителя и следите за появлением дополнительных неисправностей.
Подтвердите неисправность накопителя, распознавание замены, начало восстановления, пропускную способность, температуру и оставшееся состояние накопителя. В примере конфигурации HPE ProLiant DL380 Gen10 варианты накопителей включают отсеки SFF или LFF и устройства SATA, SAS и NVMe, при этом поддержка NVMe SSD привязана к выделенной объединительной плате NVMe. Выбор контроллера также позволяет разделить встроенный контроллер массива, опциональный HBA и опциональные контроллеры Smart Array с различными протоколами, уровнями RAID, слотами и возможностями кэширования.
Когда следует замедлить, остановить или ускорить процесс восстановления?
Необходимо принять срочные меры, если приближается отказ другого накопителя, увеличивается количество ошибок носителя, повышается температура, повторяются ошибки контроллера, падает пропускная способность восстановления или задержка в процессе производства становится неприемлемой. Слепое ожидание может привести к худшим последствиям, когда характер отказов изменится.
После восстановления: проверьте состояние массива и восстановите резервное покрытие.
Не следует рассматривать 100% прогресс восстановления как финишную линию. Необходимо подтвердить оптимальное состояние, проверить целостность данных, просмотреть журналы контроллера, записи о неисправных дисках, данные мониторинга и информацию о восстановленных резервных дисках. В примере конфигурации HPE ProLiant DL385 Gen11 варианты контроллера хранения данных включают модуль HPE Smart Array или трехрежимный контроллер на базе PCIe с кэшем до 8 ГБ, а пути доступа к хранилищу включают 3,5-дюймовые SATA/SAS, 2,5-дюймовые SATA/SAS/NVMe, EDSFF E3.S NVMe и загрузочное устройство NVMe с возможностью горячей замены.
Используйте фактические результаты реконструкции для улучшения следующего плана.
Записывайте продолжительность, пропускную способность, влияние на приложения, изменения в регулировании, оповещения и решения оператора. В том же контексте конфигурации DL385 Gen11 указаны стандартные адаптеры PCIe или две дополнительные карты OCP 3.0, восемь стандартных слотов PCIe 5.0, дополнительные резервные блоки питания 2200 Вт 1+1 с возможностью горячей замены и резервные вентиляторы с возможностью горячей замены. Эти зависимости показывают, почему план должен улучшаться после каждого события.
Часто задаваемые вопросы
В: Как следует оценивать время восстановления RAID-массива для больших корпоративных дисков в соответствии с планом планирования?
A: Оцените емкость, разделив ее на эффективную пропускную способность восстановления, затем скорректируйте с учетом операций ввода-вывода в реальном времени, приоритета контроллера, состояния дисков, ширины массива и фоновых задач.
В: Чем отличается планирование восстановления RAID-массива для RAID 5, RAID 6 и RAID 10?
A: В RAID 5 после выхода из строя одного диска запас по четности исчерпан, в RAID 6 обычно сохраняется дополнительный запас, а в RAID 10 восстановление обычно происходит с использованием зеркального диска партнера.
В: Как при планировании восстановления RAID-массива следует учитывать потерю производительности во время восстановления?
A: Определите допустимые задержку и пропускную способность до возникновения сбоя, сократите некритическую нагрузку и скорректируйте приоритет восстановления, когда влияние на производственную среду превысит пороговое значение.
В: Сколько резервных дисков следует включить в план восстановления RAID-массива предприятия?
A: Расчет производится на основе количества массивов, семейства дисков, емкости, областей отказа, времени выполнения заказа на замену, целевого показателя обслуживания и времени восстановления после замены.
В: Какие предупреждающие признаки следует учитывать при планировании восстановления RAID-массива в случае его деградации?
A: Следите за появлением дополнительных сбоев прогнозирования, ростом ошибок носителя, аномальной температурой, повторными предупреждениями контроллера, падением пропускной способности восстановления и задержкой, превышающей лимит, установленный в руководстве по эксплуатации.
