RAID 縮退後に直ちにディスク交換できるか:再構築中の二次障害リスク
RAID 縮退時はアレイ、スロット、シリアル、バックアップ、コントローラーを確認してから正しいディスクを交換し、再構築を監視します。
変更前にリスクと切戻しを確定試験環境または代表一台で先に確認し、構成、ログ、復元可能なバックアップを保存します。本番切替、一括ポリシー、DB 修復、ストレージ再構築では保守時間と切戻し条件を設定します。
1. 結論と対象範囲
縮退アレイは冗長性を一部失っています。再構築は残存ディスクを長時間全読取りするため、潜在不良や第二障害が表面化しやすい工程です。交換前にバックアップと物理スロットを確認し、OS のドライブ文字だけで判断しません。
バックアップ、ストレージ、復旧、事業継続に関係します。成功表示ではなく実復元で確認します。
2. 優先して確認するリスク兆候
- コントローラーに Degraded、Predictive Failure、Foreign、再構築率が表示される。
- 警告 LED、管理画面、ディスクシリアルの対応が不明確である。
3. 変更前の確認項目
- RAID レベル、仮想ディスク、構成員、ホットスペア、キャッシュ、バッテリー/キャパシタを確認します。
- 故障スロット、シリアル、容量、接続、セクター形式、ファームウェアを記録します。
- 再構築前に重要バックアップが読めることを確認し、必要なら追加コピーを作ります。
- 他の構成員の媒体エラー、予兆、SMART、コントローラーイベントを確認します。
読取中心の確認・検証例
# サーバーベンダーのコントローラーツールを使用。コマンドは機種により異なります
# storcli /c0 /vall show
# storcli /c0 /eall /sall show allcorp.example、192.0.2.0/24、203.0.113.0/24 は文書用の例です。実環境の値を確認したうえで置き換えてください。
4. 推奨実施手順
- ベンダー管理ツールで故障スロットを点灯確認し、対応ホットスワップ手順で交換します。
- 交換品は元容量以上で、対応シリーズとファームウェアを優先します。
- 再構築中は不要 I/O を減らし、温度、エラー、速度、完了予測を監視します。
- 完了後に整合性検査と新バックアップを行い、再構築をバックアップと考えません。
リモート調査と現地作業の判断ログ、構成、少数対象は通常リモートで評価できます。物理サーバー、ストレージ、電源、全体切替、復元訓練は管理された現地作業枠を使用します。浙江・上海・江蘇は案件により訪問対応し、その他地域はリモート支援します。
5. 検証、切戻し、よくある誤り
- アレイが Optimal に戻り、全ディスクとキャッシュが正常です。
- 整合性検査に新規媒体エラーがなく、OS とアプリが安定します。
- 最新完全バックアップと復元試験が成功します。
よくある誤り
- ドライブ文字や位置を推測して誤ディスクを抜く。
- 縮退中に再起動、ファームウェア更新、複数交換を行う。
- 再構築成功後に他の老朽ディスクとバックアップを無視する。
よくある質問
縮退後すぐ交換しますか。
早期対応は必要ですが、先にバックアップ、スロット、他ディスク状態を確認します。
再構築中も業務利用できますか。
通常は可能ですが性能とリスクが上がるため、負荷を下げて停止・復旧手順を準備します。
前の記事Veeam のイミュータブルバックアップと Hardened Repository でランサムウェア削除を防ぐ次の記事停電時に UPS で Windows Server、仮想化ホスト、NAS を正しい順序で安全停止する
実環境に合わせた判断が必要ですか。
バージョン、構成図、完全なエラー、イベント時刻、影響範囲、直近変更、実施済み操作をご提供ください。リスク、対応範囲、切戻しを確認してから実施範囲を整理します。
