RAID / NAS / SAN

Macierz to nie jeden dysk — i nie można jej traktować jak jednego dysku.

W środowiskach RAID dane są rozłożone między wiele urządzeń zgodnie z określonym układem. Przy awarii znaczenie mają poziom RAID, kolejność dysków, rozmiar stripe, offset, parzystość, stan poszczególnych nośników oraz system plików znajdujący się ponad macierzą.

Macierz RAID
RAID0 · 1 · 5 · 6 · 10 · NAS · storage
NAJCZĘSTSZE SCENARIUSZE

Awarie wielowarstwowe.

Problem może dotyczyć jednego dysku, kilku dysków jednocześnie, kontrolera, konfiguracji logicznej, systemu plików albo danych aplikacyjnych. Błędna diagnoza jednej warstwy może prowadzić do nadpisania danych na kolejnej.

  • dwa lub więcej dysków w stanie failed/degraded;
  • nieudany lub przerwany rebuild;
  • utrata konfiguracji kontrolera;
  • przestawiona kolejność dysków;
  • awaria NAS-a przy sprawnych nośnikach;
  • uszkodzenie systemu plików lub woluminu po awarii zasilania;
  • problemy z datastore lub warstwą wirtualizacji nad macierzą.
KRYTYCZNA ZASADA

Nie uruchamiaj rebuild „na próbę”.

Rebuild jest operacją zapisującą. Jeżeli konfiguracja macierzy jest błędna, któryś dysk ma starszą zawartość albo kilka nośników jest niestabilnych, przebudowa może nadpisać dane, które wcześniej dało się odczytać. Przed taką operacją należy znać stan poszczególnych dysków i parametry macierzy.

CO ANALIZUJEMY

Parametry potrzebne do rekonstrukcji

Poziom RAID

RAID 0, 1, 5, 6, 10 oraz wybrane warianty producentów i systemów NAS.

Kolejność dysków

Fizyczna kolejność w obudowie nie zawsze odpowiada logicznej kolejności zapisu.

Stripe / offset / parity

Parametry określające sposób rozłożenia danych i parzystości pomiędzy nośnikami.

Warstwa logiczna

System plików, LVM, woluminy, datastore lub inne struktury nad samą macierzą.

PROCES

Bezpieczna kolejność prac

01

Inwentaryzacja

Oznaczenie dysków, kolejności, numerów seryjnych, stanu i historii zdarzenia.

02

Kopie nośników

W miarę możliwości wykonywane są obrazy poszczególnych dysków, zwłaszcza tych niestabilnych.

03

Wirtualna rekonstrukcja

Parametry macierzy są odtwarzane bez wykonywania zapisów na oryginalnych nośnikach.

04

Ekstrakcja danych

Po potwierdzeniu poprawnej geometrii analizowany jest system plików i odzyskiwane są wymagane dane.

Przed wysyłką RAID/NAS:

Nie zmieniaj kolejności dysków. Oznacz każdą zatokę i każdy nośnik, zachowaj logi kontrolera/NAS, zrzuty ekranu stanu macierzy i informacje o ostatnich zmianach konfiguracji.

POZIOMY RAID

Redundancja nie oznacza kopii zapasowej.

RAID ma przede wszystkim zwiększać dostępność lub wydajność. Nie chroni przed przypadkowym skasowaniem danych, błędem administratora, ransomware, uszkodzeniem systemu plików ani awarią obejmującą większą liczbę dysków niż zakłada dany poziom.

RAID 0

Dane są rozdzielane między dyski bez redundancji. Utrata jednego nośnika może przerwać ciągłość danych całej macierzy.

RAID 1

Lustrzane kopie mogą ułatwiać odtworzenie po awarii jednego dysku, ale błędne zapisy i usunięcia są zwykle replikowane na oba nośniki.

RAID 5 / 6

Parzystość umożliwia tolerowanie określonej liczby awarii, lecz rebuild mocno obciąża pozostałe dyski i nie naprawia uszkodzeń logicznych.

RAID 10

Łączy striping i mirroring. Przy odzyskiwaniu nadal trzeba ustalić pary, kolejność dysków i to, które kopie są najbardziej aktualne.

NAS I URZĄDZENIA PRODUCENTA

Metadane macierzy mogą być zapisane na dyskach, kontrolerze albo w obu miejscach.

Urządzenia NAS i sprzętowe kontrolery RAID często zapisują własne informacje o woluminach, kolejności nośników, spare’ach czy historii przebudowy. W przypadku migracji do innego kontrolera lub resetu konfiguracji część tych informacji może zostać zmieniona.

Dlatego warto zachować pliki konfiguracyjne, eksport ustawień, logi zdarzeń, zdjęcia zatok i wszystkie informacje z interfejsu administracyjnego sprzed awarii.

CO PRZEKAZAĆ
  • wszystkie dyski należące do macierzy, również oznaczone jako failed;
  • informację, który dysk i kiedy został wymieniony;
  • numer zatoki dla każdego nośnika;
  • model kontrolera lub urządzenia NAS;
  • poziom RAID, jeśli jest znany;
  • logi, screenshoty i alerty sprzed oraz po awarii;
  • opis działań wykonanych po utracie dostępu do danych.