Skip to content

監視とトラブルシューティング ​

継続的な DR 対応能力は、健全なレプリケーションと最新の復旧ポイントに依存します。このページでは、監視すべき項目と一般的な問題の解決手順について説明します。

監視すべき項目 ​

  • レプリケーションステータス (Replication status) — 保護された各ワークロードがアクティブにレプリケーション中であること(または意図的に一時停止されていること)。
  • 最後の成功同期日時 (Last successful sync) — ワークロードが最後に正常にレプリケーションされた時間。
  • 復旧ポイントの経過時間 (Recovery-point age) — 最新の復旧ポイントからの経過時間。これは、今災害が発生した場合に想定される実際のデータ損失範囲を表します。
  • 復旧ポイントの世代数 (Recovery-point count) — DR サイトに想定される世代数の復旧ポイントが存在していること。
  • サイトペアリングの状態 (Site pairing status) — Cockpit および DRM の両ピアで connected / paired と表示されていること。

DRM の Overview では保護されたすべてのワークロードにわたる総合的な DR 健全性が表示され、Workloads ビューではワークロードごとの詳細なステータスを確認できます。

レプリケーションステータスの理解 ​

ステータス意味
Replicating / Idle正常。スケジュール通りに同期中、または次のサイクルを待機中
Paused意図的に一時停止中。新しい復旧ポイントは作成されません
Degraded (低下)直近の同期がリカバリサイトに完全に届きませんでした。自動的に再試行されます
Failing over / Failed overフェイルオーバーが進行中、または完了しました
Error操作が失敗し、対応が必要です

Degraded ステータスは隠蔽されず正確に表示されます

レプリケーションサイクルがリカバリサイトへ転送できなかった場合、正直に失敗として報告され、利用不可能な復旧ポイントが作成されることはありません。つまり、画面に表示されるステータスは実際に復元可能なデータを正確に反映しています。Degraded や Error が継続する場合は、迅速に対処すべきリスクとして扱ってください。

一般的な問題と解決手順 ​

ワークロードの復旧ポイントが更新されない ​

  • ワークロードが Paused(一時停止)になっていないか確認してください(一時停止中のワークロードは新しい復旧ポイントを作成しません。再開してください)。
  • サイトペアリングが connected になっていること、およびポート 7770/7771/7772 でサイト間に到達できることを確認してください。
  • Degraded ステータスになっていないか確認してください。これはサイト間転送が失敗していることを示します。ネットワーク接続またはストレージの原因を解決すれば自動的に再試行されます。

フェイルオーバーまたはテストフェイルオーバーが無効(グレーアウト)になっている ​

  • 対象 Cockpit で Disaster Recovery エンタイトルメントが有効になっていません。そのサイトのライセンス状態を確認してください。
  • ワークロードにアクティブなレプリケーションジョブがないか、別の操作がすでに実行中です。

「No replica available for failover」(フェイルオーバーに使用できるレプリカがありません) ​

  • リカバリサイトで復旧ポイントがまだ完了していません。ベースライン同期が完了し、復旧ポイントが存在することを確認してください。
  • リカバリサイトのストレージプールがハイパーバイザープロセスからアクセス可能であることを確認してください(アクセス制限されたプールでは復旧ディスクのオープンに失敗することがあります)。

緊急フェイルオーバーが拒否される ​

  • 送信元のワークロードが依然として到達可能かつ稼働中であることを DRM が検出し、スプリットブレイン(同一ワークロードが両サイトで同時に稼働する状態)を防ぐために拒否しました。プライマリが完全にダウンしていることを確認するか、安全であると確信できる場合にのみ明示的なオーバーライドを使用してください。

ペアリングで「Invalid token」と表示される、または接続に失敗する ​

  • API アクセストークンの有効期限が切れたか取り消されました。リモートサイトで新しい永続トークンを作成し、ペアリングを再登録してください。
  • リモートサイトがループバックではなくルーティング可能な IP で登録されていること、およびサイト間ポートが開放されていることを確認してください。

障害発生前の備え:リハーサルの重要性 ​

実際の災害時に予期せぬトラブルを防ぐ最善の方法は、定期的にテストフェイルオーバーを実行することです。業務無停止でリカバリパス全体を検証し、すべてのディスクを含めてワークロードがリカバリサイトで確実に起動することを確認できます。詳細は フェイルオーバーとリカバリ を参照してください。