Skip to content

نسخ الموقع وتوفير التعافي من الكوارث (DR)

يوفر Cockpit إمكانية التعافي من الكوارث على مستوى hypervisor من خلال النسخ المتماثل للأجهزة الافتراضية بنمط النشط-الخامل (active-passive). يمكن هذا بيئات العمل التي تعمل في مركز البيانات الرئيسي (Site A) من نسخ أجهزة التخزين الكتلي بشكل غير متزامن إلى موقع تعافٍ ثانوي من الكوارث (Site B) عبر شبكة واسعة WAN أو شبكة ثانوية.


1. التصميم المعماري

يتم تنسيق النسخ المتماثل بواسطة Cockpit ولكنه يُنفذ مباشرة بين الأطراف (peer-to-peer) بين خوادم التلخيص الفيزيائية (برامج Vapor الخلفية) لتحسين إنتاجية الشبكة وتقليل عوائق لوحة الإدارة.

  • بروتوكول نقل البيانات: يتم بث الملفات وتصحيحات التغييرات الكتلية التراكمية عبر TLS آمن باستخدام بروتوكول TUS (الرفع القابل للاستئناف) (طلبات HTTP من نوع PATCH).
  • لقطات التخزين غير المتزامنة: تستخدم سلاسل الدعم لـ QCOW2 لنقل الكتل دون تعطيل الأجهزة الافتراضية النشطة.

2. آلية النسخ المتماثل

يعمل النسخ المتماثل في عملية ثنائية المراحل باستخدام طبقات اللقطات (Snapshot layers):

المرحلة 1: المزامنة الأساسية (نسخ كامل)

  1. يوجه Cockpit مضيف Vapor المصدر لإنشاء نسخة احتياطية كاملة.
  2. يجمد hypervisor نظام الملفات الضيف مؤقتًا (عبر QEMU Guest Agent) ويدير qemu-img convert لبث حجم القرص.
  3. يسجل Cockpit جلسة الرفع على مضيف Vapor المستهدف.
  4. يبث Vapor المصدر ملف .qcow2 الأساسي كتلًا تلو الأخرى باستخدام بروتوكول TUS.
  5. يسجل Vapor المستهدف صورة القرص الأساسية.

المرحلة 2: المزامنة التراكمية (الموجهة بـ RPO)

  1. عند الفاصل الزمني المحدد لهدف نقطة الاستعادة (RPO) (مثل 15 دقيقة)، يطلق Cockpit مزامنة تراكمية.
  2. يقفل Vapor المصدر QEMU، وينشئ ملف تراكب جديدًا، ويدير qemu-img convert مع الإشارة إلى لقطة الأصل:
    bash
    qemu-img convert -O qcow2 -o backing_file=parent.qcow2,backing_fmt=qcow2 source.qcow2 delta.qcow2
  3. يبث Vapor المصدر ملف التصحيح delta.qcow2 فقط عبر طلبات PATCH بروتوكول TUS إلى المضيف المستهدف.
  4. يكتب Vapor المستهدف تصحيح الكتل الفرعية في سلسلة دعم النسخ المتماثل، مما ينشئ حالة استعادة لنقطة زمنيًا (PIT).

3. خطوات الإعداد

3.1 ربط أزواج المواقع

قبل تسجيل بيئات العمل، يجب على المسؤولين ربط أزواج مواقع Cockpit:

  1. قم بتسجيل الدخول إلى مثيلة Cockpit المستهدفة (DR) واستخرج رمز التفويض النشط (من cockpit:auth في التخزين المحلي).
  2. قم بتسجيل الدخول إلى مثيلة Cockpit الرئيسية، وانتقل إلى Configure -> Site Pairs، وانقر على Link Site Pair.
  3. أدخل اسم الموقع البعيد، وعنوان URL لـ API (مثل https://192.168.122.128:7771/api/v1)، والرمز، وشهادات TLS الاختيارية.

3.2 تسجيل الأجهزة الافتراضية

  1. حدد الجهاز الافتراضي المستهدف في شجرة المخزون وانتقل إلى تبويب Replication.
  2. قم بإعداد سياسة النسخ المتماثل:
    • Target Site: حدد موقع التعافي المربوط.
    • Target Datastore: حدد مجمع التخزين في موقع التعافي.
    • RPO (Recovery Point Objective): حدد الفواصل الزمنية للمزامنة (15 Minutes، 30 Minutes، 1 Hour، 4 Hours، أو 24 Hours).
    • PIT Snapshots: الحد الأقصى لعدد نقاط التحقق التاريخية المراد الاحتفاظ بها في موقع التعافي (عدد نقاط الاستعادة الزمنية المتعددة).
    • Data Compression: خيار لضغط بث القرص أثناء النقل لتحسين نطاق شبكة WAN.
  3. انقر على Enable Replication لبدء المزامنة الأساسية.

4. مسارات عمل التعافي من الكوارث

يبدأ المسؤولون إجراءات الاستعادة والتحقق من قائمة ACTIONS ▾ في لوحة حالة النسخ المتماثل للجهاز الافتراضي:

4.1 التبديل التجريبي عند الفشل (تمارين التعافي من الكوارث)

للتحقق من جدوى الاستعادة دون تعطيل الجهاز الافتراضي للإنتاج أو إيقاف النسخ المتماثل:

  1. حدد Test Failover وانقر على Start Drill.
  2. إجراء الخلفية: يستنسخ Cockpit تخزين النسخة المستهدفة من أحدث لقطة PIT، وينشئ مثيلة جهاز افتراضي مؤقتة، ويقيلعها داخل شبكة مضيف معزولة (شبكة الفقاعة - bubble network).
  3. تحقق من خدمات نظام التشغيل الضيف للجهاز الافتراضي عبر وحدة التحكم.
  4. حدد Stop Test Failover لإيقاف تشغيل الجهاز الافتراضي المؤقت وحذف النسخ المؤقتة من مجمع تخزين موقع التعافي.

4.2 الترحيل المخطط له (التبديل السلس)

يُستخدم لنقل بيئات العمل بشكل دائم أثناء الصيانة المجدولة:

  1. حدد Planned Migration وانقر على Start Migration.
  2. إجراء الخلفية:
    • يتم إيقاف تشغيل الجهاز الافتراضي الرئيسي بنظافة.
    • تنفذ مزامنة استدراكية أخيرة للنسخ المتماثل لنقل أي كتل متسخة متبقية.
    • يتم حذف تسجيل الجهاز الافتراضي من المضيف الرئيسي، ويسجل الجهاز الافتراضي ويُقلع على مضيف التعافي.

4.3 التبديل الطارئ عند الفشل (انقطاع غير مخطط له)

يُستخدم عندما يكون مركز البيانات الرئيسي غير متصل بالإنترنت بسبب كارثة:

  1. حدد Emergency Failover وانقر على Emergency Failover.
  2. إجراء الخلفية: يتجاوز Cockpit إيقاف تشغيل الجهاز الافتراضي الرئيسي والمزامنة النهائية. ويسجل الجهاز الافتراضي على مضيف التعافي فورًا باستخدام أحدث لقطة PIT تم مزامنتها بنجاح ويشغل الجهاز الافتراضي.