Kısa cevap

vSphere HA, cluster'daki bir host arızalandığında o host üzerinde çalışan sanal makineleri başka host'larda yeniden başlatır. Kesintisiz çalışma sağlamaz: sanal makineler kapanır ve yeniden açılır. Amaç kesintiyi sıfırlamak değil, kısaltmaktır.

Neden bu ayrım önemli?#

HA sık sık "sunucu çökse bile hiçbir şey olmaz" diye anlatılır. Doğru ifade şudur: sunucu çökerse sanal makineler birkaç dakika içinde başka bir sunucuda yeniden açılır. Bu sürede:

  • Sanal makineler kapalıdır.
  • İşletim sistemi temiz kapanmadığı için dosya sistemi kurtarma yapabilir.
  • Uygulama, beklenmedik kapanmadan etkilenmiş olabilir.

Bu kabul edilebilir bir davranıştır — ama ne olduğunu bilerek planlamak gerekir.

HA nasıl karar verir?#

Cluster'daki host'lar birbirini sürekli izler. Mimari kabaca şöyle işler:

Arıza anındaki akış

  1. Cluster içinde bir host master rolünü üstlenir; diğerleri onunla haberleşir.
  2. Master, host'lardan gelen ağ kalp atışlarını (heartbeat) izler.
  3. Bir host'tan kalp atışı gelmeyi kesince, master paylaşılan datastore üzerinden ikinci bir kontrol yapar.
  4. Host gerçekten erişilemiyorsa, üzerindeki sanal makineler diğer host'larda yeniden başlatılır.

Yalıtılmış host ne yapar?#

Bir host ağdan yalıtıldığını fark ettiğinde, yapılandırmaya göre sanal makineleri kapatabilir, güç kesebilir veya çalışır bırakabilir. Bu davranış (isolation response) cluster ayarlarında belirlenir ve ortamın yapısına göre seçilmelidir.

Admission control#

HA'nın yeniden başlatma sözü, ancak kalan host'larda yeterli kapasite varsa tutulabilir. Admission control tam olarak bunu güvence altına alır: cluster'da bir host arızası için kapasite ayrılmasını zorunlu kılar ve bu kapasiteyi tüketecek yeni sanal makinelerin açılmasını engeller.

HA neyi kapsamaz?#

Sık karıştırılan süreklilik mekanizmaları
MekanizmaNeye karşı korurKesinti
HAHost donanım arızasıSanal makine yeniden başlar
Fault ToleranceHost arızası (kesintisiz)Kesinti yok, kaynak maliyeti yüksek
YedeklemeSilme, bozulma, fidye yazılımıGeri yükleme süresi kadar
ReplikasyonSite/depolama kaybıDevralma süresi kadar

Tablo yatay olarak kaydırılabilir.

HA bir yedekleme değildir. Bir sanal makine içindeki veriler silinirse, şifrelenirse veya bozulursa HA hiçbir şey yapmaz; çünkü ortada bir host arızası yoktur. Aynı şekilde, sanal makine içindeki işletim sistemi çökerse HA varsayılan olarak devreye girmez — bunun için ayrıca konuk izleme (VM monitoring) etkinleştirilmelidir.

Kontrol listesi#

  • Paylaşılan depolamaya tüm host'lar erişebiliyor mu?
  • Yönetim ağı yedekli mi? Tek bir anahtar arızası cluster'ı bölüyor mu?
  • Admission control açık ve ayrılan kapasite gerçek mi?
  • Kritik sanal makinelerin yeniden başlatma önceliği tanımlı mı?
  • Bir host kaybında kalan host'lar toplam yükü taşıyabiliyor mu?

Önemli noktalar

  • HA, host arızasında sanal makineleri başka host'ta yeniden başlatır; kesintisizlik sağlamaz.
  • Datastore heartbeating, ağdan yalıtılmış host ile çökmüş host'u ayırt eder.
  • Admission control olmadan HA'nın sözü kapasiteyle desteklenmez.
  • HA yedekleme değildir; veri kaybı senaryolarında devreye girmez.