監視とトラブルシューティング
継続的な DR 対応能力は、健全なレプリケーションと最新の復旧ポイントに依存します。このページでは、監視すべき項目と一般的な問題の解決手順について説明します。
監視すべき項目
- レプリケーションステータス (Replication status) — 保護された各ワークロードがアクティブにレプリケーション中であること(または意図的に一時停止されていること)。
- 最後の成功同期日時 (Last successful sync) — ワークロードが最後に正常にレプリケーションされた時間。
- 復旧ポイントの経過時間 (Recovery-point age) — 最新の復旧ポイントからの経過時間。これは、今災害が発生した場合に想定される実際のデータ損失範囲を表します。
- 復旧ポイントの世代数 (Recovery-point count) — DR サイトに想定される世代数の復旧ポイントが存在していること。
- サイトペアリングの状態 (Site pairing status) — Cockpit および DRM の両ピアで connected / paired と表示されていること。
DRM の Overview では保護されたすべてのワークロードにわたる総合的な DR 健全性が表示され、Workloads ビューではワークロードごとの詳細なステータスを確認できます。
レプリケーションステータスの理解
| ステータス | 意味 |
|---|---|
| Replicating / Idle | 正常。スケジュール通りに同期中、または次のサイクルを待機中 |
| Paused | 意図的に一時停止中。新しい復旧ポイントは作成されません |
| Degraded (低下) | 直近の同期がリカバリサイトに完全に届きませんでした。自動的に再試行されます |
| Failing over / Failed over | フェイルオーバーが進行中、または完了しました |
| Error | 操作が失敗し、対応が必要です |
Degraded ステータスは隠蔽されず正確に表示されます
レプリケーションサイクルがリカバリサイトへ転送できなかった場合、正直に失敗として報告され、利用不可能な復旧ポイントが作成されることはありません。つまり、画面に表示されるステータスは実際に復元可能なデータを正確に反映しています。Degraded や Error が継続する場合は、迅速に対処すべきリスクとして扱ってください。
一般的な問題と解決手順
ワークロードの復旧ポイントが更新されない
- ワークロードが Paused(一時停止)になっていないか確認してください(一時停止中のワークロードは新しい復旧ポイントを作成しません。再開してください)。
- サイトペアリングが connected になっていること、およびポート
7770/7771/7772でサイト間に到達できることを確認してください。 - Degraded ステータスになっていないか確認してください。これはサイト間転送が失敗していることを示します。ネットワーク接続またはストレージの原因を解決すれば自動的に再試行されます。
フェイルオーバーまたはテストフェイルオーバーが無効(グレーアウト)になっている
- 対象 Cockpit で Disaster Recovery エンタイトルメントが有効になっていません。そのサイトのライセンス状態を確認してください。
- ワークロードにアクティブなレプリケーションジョブがないか、別の操作がすでに実行中です。
「No replica available for failover」(フェイルオーバーに使用できるレプリカがありません)
- リカバリサイトで復旧ポイントがまだ完了していません。ベースライン同期が完了し、復旧ポイントが存在することを確認してください。
- リカバリサイトのストレージプールがハイパーバイザープロセスからアクセス可能であることを確認してください(アクセス制限されたプールでは復旧ディスクのオープンに失敗することがあります)。
緊急フェイルオーバーが拒否される
- 送信元のワークロードが依然として到達可能かつ稼働中であることを DRM が検出し、スプリットブレイン(同一ワークロードが両サイトで同時に稼働する状態)を防ぐために拒否しました。プライマリが完全にダウンしていることを確認するか、安全であると確信できる場合にのみ明示的なオーバーライドを使用してください。
ペアリングで「Invalid token」と表示される、または接続に失敗する
- API アクセストークンの有効期限が切れたか取り消されました。リモートサイトで新しい永続トークンを作成し、ペアリングを再登録してください。
- リモートサイトがループバックではなくルーティング可能な IP で登録されていること、およびサイト間ポートが開放されていることを確認してください。
障害発生前の備え:リハーサルの重要性
実際の災害時に予期せぬトラブルを防ぐ最善の方法は、定期的にテストフェイルオーバーを実行することです。業務無停止でリカバリパス全体を検証し、すべてのディスクを含めてワークロードがリカバリサイトで確実に起動することを確認できます。詳細は フェイルオーバーとリカバリ を参照してください。