Pemantauan & Pemecahan Masalah
Kesiapan DR yang berkelanjutan bergantung pada replikasi yang sehat dan titik pemulihan yang selalu baru. Halaman ini mencakup hal-hal yang perlu dipantau dan cara mengatasi masalah umum.
Hal-hal yang perlu dipantau
- Status replikasi (Replication status) — setiap beban kerja yang dilindungi harus aktif mereplikasi (atau sengaja dijeda).
- Sinkronisasi berhasil terakhir (Last successful sync) — kapan terakhir kali beban kerja berhasil direplikasi.
- Usia titik pemulihan (Recovery-point age) — waktu yang telah berlalu sejak titik pemulihan terbaru. Ini adalah paparan potensi kehilangan data efektif Anda jika bencana terjadi saat ini.
- Jumlah titik pemulihan (Recovery-point count) — memastikan jumlah titik pemulihan yang diharapkan telah tersedia di situs DR.
- Status penyandingan situs (Site pairing status) — rekanan Cockpit dan DRM keduanya harus berstatus connected / paired.
Tampilan Overview pada DRM menampilkan ringkasan kesehatan DR agregat di semua beban kerja terlindung, sedangkan tampilan Workloads menampilkan status detail per beban kerja.
Memahami status replikasi
| Status | Arti |
|---|---|
| Replicating / Idle | Sehat; menyinkronkan sesuai jadwal atau menunggu siklus berikutnya |
| Paused | Dijeda dengan sengaja; tidak mengumpulkan titik pemulihan baru |
| Degraded | Sinkronisasi terakhir tidak sepenuhnya mencapai situs pemulihan; akan dicoba ulang |
| Failing over / Failed over | Proses failover sedang berlangsung atau telah selesai |
| Error | Suatu operasi gagal dan memerlukan perhatian |
Status degraded bersifat transparan, bukan tersembunyi
Jika suatu siklus replikasi tidak dapat mentransfer data ke situs pemulihan, sistem akan melaporkannya sebagai kegagalan dan tidak membuat titik pemulihan yang tidak valid. Artinya, status yang Anda lihat mencerminkan data yang benar-benar dapat dipulihkan — perlakukan status degraded/error yang terus-menerus sebagai risiko yang harus segera diselesaikan.
Masalah umum
Titik pemulihan beban kerja tidak diperbarui
- Pastikan beban kerja tidak berstatus Paused (beban kerja yang dijeda tidak membuat titik pemulihan baru — lanjutkan kembali).
- Pastikan penyandingan situs berstatus connected dan situs dapat dijangkau pada port
7770/7771/7772. - Periksa status Degraded, yang menandakan transfer lintas situs gagal; perbaiki kendala konektivitas atau penyimpanan agar sistem dapat mencoba ulang.
Failover atau uji failover dinonaktifkan (berwarna abu-abu)
- Hak Disaster Recovery belum diaktifkan pada Cockpit tersebut — periksa lisensi di situs terkait.
- Beban kerja tidak memiliki tugas replikasi aktif, atau operasi lain sedang berlangsung.
"No replica available for failover" (Tidak ada replika yang tersedia untuk failover)
- Titik pemulihan belum selesai di situs pemulihan — pastikan sinkronisasi baseline telah selesai dan titik pemulihan telah ada di sana.
- Pastikan pool penyimpanan di situs pemulihan dapat diakses oleh proses hypervisor (pool dengan izin terbatas dapat mencegah disk pemulihan dibuka).
Failover darurat ditolak
- DRM mendeteksi bahwa beban kerja sumber masih dapat dijangkau dan sedang berjalan, lalu menolaknya untuk mencegah split-brain (beban kerja yang sama berjalan di kedua situs). Pastikan situs utama benar-benar mati, atau gunakan penggantian manual eksplisit hanya jika Anda yakin tindakan tersebut aman.
Penyandingan menampilkan "Invalid token" atau gagal terhubung
- Token akses API kedaluwarsa atau telah dicabut — buat token permanen baru di situs jarak jauh dan daftarkan kembali penyandingan.
- Pastikan situs jarak jauh didaftarkan menggunakan IP yang dapat dirutekan, bukan loopback, dan port antar-situs telah terbuka.
Sebelum Anda membutuhkannya: lakukan latihan
Satu-satunya cara terbaik untuk menghindari kejutan saat bencana nyata adalah dengan menjalankan uji failover secara teratur. Proses ini non-disruptif, menguji seluruh alur pemulihan, dan memastikan beban kerja — termasuk setiap disk yang terpasang — benar-benar dapat di-boot di situs pemulihan. Lihat Failover & Pemulihan.