Kısa cevap
vSphere HA, cluster'daki bir host arızalandığında o host üzerinde çalışan sanal makineleri başka host'larda yeniden başlatır. Kesintisiz çalışma sağlamaz: sanal makineler kapanır ve yeniden açılır. Amaç kesintiyi sıfırlamak değil, kısaltmaktır.
Neden bu ayrım önemli?#
HA sık sık "sunucu çökse bile hiçbir şey olmaz" diye anlatılır. Doğru ifade şudur: sunucu çökerse sanal makineler birkaç dakika içinde başka bir sunucuda yeniden açılır. Bu sürede:
- Sanal makineler kapalıdır.
- İşletim sistemi temiz kapanmadığı için dosya sistemi kurtarma yapabilir.
- Uygulama, beklenmedik kapanmadan etkilenmiş olabilir.
Bu kabul edilebilir bir davranıştır — ama ne olduğunu bilerek planlamak gerekir.
HA nasıl karar verir?#
Cluster'daki host'lar birbirini sürekli izler. Mimari kabaca şöyle işler:
Arıza anındaki akış
- Cluster içinde bir host master rolünü üstlenir; diğerleri onunla haberleşir.
- Master, host'lardan gelen ağ kalp atışlarını (heartbeat) izler.
- Bir host'tan kalp atışı gelmeyi kesince, master paylaşılan datastore üzerinden ikinci bir kontrol yapar.
- Host gerçekten erişilemiyorsa, üzerindeki sanal makineler diğer host'larda yeniden başlatılır.
Yalıtılmış host ne yapar?#
Bir host ağdan yalıtıldığını fark ettiğinde, yapılandırmaya göre sanal makineleri kapatabilir, güç kesebilir veya çalışır bırakabilir. Bu davranış (isolation response) cluster ayarlarında belirlenir ve ortamın yapısına göre seçilmelidir.
Admission control#
HA'nın yeniden başlatma sözü, ancak kalan host'larda yeterli kapasite varsa tutulabilir. Admission control tam olarak bunu güvence altına alır: cluster'da bir host arızası için kapasite ayrılmasını zorunlu kılar ve bu kapasiteyi tüketecek yeni sanal makinelerin açılmasını engeller.
HA neyi kapsamaz?#
| Mekanizma | Neye karşı korur | Kesinti |
|---|---|---|
| HA | Host donanım arızası | Sanal makine yeniden başlar |
| Fault Tolerance | Host arızası (kesintisiz) | Kesinti yok, kaynak maliyeti yüksek |
| Yedekleme | Silme, bozulma, fidye yazılımı | Geri yükleme süresi kadar |
| Replikasyon | Site/depolama kaybı | Devralma süresi kadar |
Tablo yatay olarak kaydırılabilir.
HA bir yedekleme değildir. Bir sanal makine içindeki veriler silinirse, şifrelenirse veya bozulursa HA hiçbir şey yapmaz; çünkü ortada bir host arızası yoktur. Aynı şekilde, sanal makine içindeki işletim sistemi çökerse HA varsayılan olarak devreye girmez — bunun için ayrıca konuk izleme (VM monitoring) etkinleştirilmelidir.
Kontrol listesi#
- Paylaşılan depolamaya tüm host'lar erişebiliyor mu?
- Yönetim ağı yedekli mi? Tek bir anahtar arızası cluster'ı bölüyor mu?
- Admission control açık ve ayrılan kapasite gerçek mi?
- Kritik sanal makinelerin yeniden başlatma önceliği tanımlı mı?
- Bir host kaybında kalan host'lar toplam yükü taşıyabiliyor mu?
Önemli noktalar
- HA, host arızasında sanal makineleri başka host'ta yeniden başlatır; kesintisizlik sağlamaz.
- Datastore heartbeating, ağdan yalıtılmış host ile çökmüş host'u ayırt eder.
- Admission control olmadan HA'nın sözü kapasiteyle desteklenmez.
- HA yedekleme değildir; veri kaybı senaryolarında devreye girmez.