Failover & Pemulihan
Failover menyalakan beban kerja yang dilindungi di situs pemulihan. Terdapat tiga jenis failover, dan memilih jenis yang tepat sangatlah krusial.
| Jenis | Mengganggu? | Sumber terpengaruh? | Kapan digunakan |
|---|---|---|---|
| Uji failover (Test failover) | Tidak | Tidak | Latihan pemulihan, kapan saja |
| Migrasi terencana (Planned migration) | Ya (tertib) | Dimatikan secara tertib | Pemindahan terjadwal saat situs utama masih sehat |
| Failover darurat (Emergency failover) | Ya | Tidak disentuh | Situs utama lumpuh atau tidak dapat dijangkau |
Tindakan ini berlisensi dan dijaga
Failover, migrasi terencana, uji failover, dan reprotect memerlukan hak Disaster Recovery aktif di Cockpit. Jika tidak berlisensi, kontrol akan dinonaktifkan dengan tooltip penjelasan.
Uji failover (Latihan pemulihan)
Uji failover mem-boot salinan beban kerja di situs pemulihan dalam jaringan gelembung terisolasi (isolated bubble network). VM produksi tetap berjalan normal dan tidak pernah disentuh, sehingga Anda dapat melatih pemulihan dengan aman sesering yang diinginkan.
Cara menjalankan: dari tab Replikasi di Cockpit pilih Test Failover, atau dari tampilan rencana/failover DRM pilih Test.
Yang perlu diverifikasi: salinan uji berhasil di-boot, dan (jika guest memiliki agen dan pemetaan IP) dapat diakses pada alamat yang dipetakan. Setiap disk pada beban kerja multi-disk harus terpasang lengkap dari replika.
Selalu bersihkan: setelah selesai, pilih Stop Test Failover (atau Cleanup test pada rencana). Tindakan ini menghapus salinan terisolasi dan jaringan sementaranya. Uji coba yang dibiarkan berjalan akan terus mengonsumsi sumber daya komputasi dan penyimpanan.
Uji failover adalah jaring pengaman Anda
Jalankan uji failover setelah melindungi beban kerja, setelah mengubah konfigurasinya, dan secara berkala. Ini adalah satu-satunya cara non-disruptif untuk membuktikan bahwa beban kerja benar-benar dapat dipulihkan.
Migrasi terencana (Planned migration)
Migrasi terencana adalah pemindahan tertib dan terkoordinasi saat situs utama masih sehat — misalnya, selama jendela pemeliharaan atau relokasi pusat data terjadwal.
Langkah-langkahnya meliputi:
- Mematikan beban kerja secara halus di situs utama.
- Menjalankan sinkronisasi delta akhir agar tidak ada data yang hilang.
- Mem-boot beban kerja di situs pemulihan.
Karena sumber dipastikan telah berhenti sebelum pemulihan di-boot, tidak ada risiko beban kerja berjalan di dua tempat secara bersamaan.
Cara menjalankan: dari tab Replikasi Cockpit pilih Planned Migration, atau jalankan rencana pemulihan yang langkah-langkahnya menggunakan tindakan failover saat situs utama masih aktif.
Failover darurat (Emergency failover)
Failover darurat ditujukan untuk bencana sesungguhnya — situs utama offline atau tidak dapat dijangkau. Tindakan ini segera mendaftarkan dan menyalakan beban kerja di situs pemulihan dari titik pemulihan terakhir yang tersedia.
Cara menjalankan: dari tab Replikasi Cockpit pilih Emergency Failover (Anda akan diminta konfirmasi), atau jalankan rencana pemulihan yang direplikasi dari DRM yang selamat.
Gunakan failover darurat hanya jika situs utama benar-benar mati
Failover darurat memulihkan dari titik pemulihan terakhir, sehingga data apa pun yang ditulis setelah titik tersebut akan hilang. Jika situs utama sebenarnya masih berjalan, memaksakan pemulihan dapat memicu kondisi split-brain (beban kerja yang sama aktif di kedua situs). DRM mencegah hal ini dengan memverifikasi terlebih dahulu bahwa sumber telah mati atau tidak dapat dijangkau; jika sumber masih dapat dijangkau dan berjalan, failover akan ditolak kecuali Anda menggantinya secara eksplisit.
Pemilihan titik pemulihan
Failover mem-boot dari titik pemulihan terakhir yang telah selesai di situs pemulihan. Titik pemulihan yang data dasarnya belum lengkap tidak akan pernah ditawarkan — hanya titik yang dapat dipulihkan secara fisik yang digunakan. Anda dapat meninjau titik pemulihan yang tersedia untuk beban kerja di tab Replikasi Cockpit atau tampilan titik pemulihan DRM.
Setelah failover
Setelah beban kerja berjalan di situs pemulihan, langkah berikutnya biasanya adalah melindungi ulang (reprotect) beban kerja tersebut (mereplikasikannya kembali ke arah situs asal) dan kemudian melakukan failback. Lihat Perlindungan Ulang & Failback.