Microsoft 365 ve Azure Hizmetlerinde Yaşanan Büyük Kesintinin Nedeni
2023 yılında Microsoft tarafından yayınlanan resmi açıklamaya göre, 30 Kasım 2023 tarihinde yaşanan büyük ölçekli Microsoft 365 ve Azure hizmet kesintisinin temel nedeni, otomatik ağ bakım sistemi içerisinde bulunan bir yazılım hatasıdır. Bu hata, sistemin IP rotalarını gereğinden fazla sayıda cihazdan kaldırmasına neden olmuş ve sonuç olarak hizmetlere erişimde ciddi kesintilere yol açmıştır.
Olayın ardından Microsoft mühendisleri tarafından yapılan incelemelerde, ağ altyapısının otomatik bakım sırasında IP rotalarının yanlışlıkla silindiği tespit edilmiştir. Bu durum, Azure veri merkezleri ve Microsoft 365 hizmetleri arasındaki bağlantının geçici olarak kopmasına neden olmuştur. Kesinti süresince kullanıcılar, Outlook, Teams, OneDrive ve diğer Microsoft 365 uygulamalarına erişimde sorunlar yaşamışlardır.
Olayın Teknik Detayları
Microsoft'un otomatik ağ bakım sistemi, genellikle IP rotalarının güncellenmesi ve optimize edilmesi amacıyla kullanılmaktadır. Ancak 30 Kasım tarihinde gerçekleşen bakım sırasında, sistemdeki bir mantık hatası, aşağıdaki adımların yanlış şekilde yürütülmesine neden olmuştur:
- Bakım talebinin oluşturulması: Sistem, otomatik olarak ağ cihazlarından (yönlendiriciler, anahtarlar) IP rotalarını kaldırmak üzere bir bakım talebi oluşturmuştur.
- Hatanın tetiklenmesi: Bir yazılım hatası nedeniyle, sistem gereken sayıdan çok daha fazla sayıda IP rotasını silmiştir. Bu durum, özellikle büyük veri merkezlerinde bulunan yüzlerce cihazdan rotaların kaldırılmasına yol açmıştır.
- Bağlantı kopması: IP rotalarının silinmesi, Azure veri merkezleri ile kullanıcıların internet bağlantıları arasındaki köprülerin geçici olarak kopmasına neden olmuştur. Bu da Microsoft 365 hizmetlerine erişimin durmasına yol açmıştır.
- Otomatik kurtarma girişimleri: Microsoft mühendisleri, sorunun fark edilmesi üzerine otomatik kurtarma sistemlerini devreye almış, ancak bazı durumlarda kurtarma işlemlerinin gecikmesi nedeniyle hizmetlerin normale dönmesi daha uzun sürmüştür.
Etkilenen Hizmetler ve Kapsam
Bu hata, aşağıdaki Microsoft hizmetlerini doğrudan etkilemiştir:
- Microsoft 365: Outlook, Teams, OneDrive, SharePoint ve diğer uygulamalar.
- Azure: Azure Active Directory, Azure Storage, Azure Virtual Machines ve diğer bulut hizmetleri.
- Diğer hizmetler: Microsoft'un diğer çevrimiçi hizmetleri, özellikle Office.com ve Azure portalı.
Kesinti süresince kullanıcılar, e-posta gönderememiş, dosya paylaşamamış ve çevrimiçi toplantılara katılamamıştır. Microsoft, olayın ardından hizmetlerin ortalama 4 saat boyunca erişilemez olduğunu doğrulamıştır.
Microsoft'un Aldığı Önlemler
Microsoft mühendisleri, olayın ardından aşağıdaki adımları uygulamıştır:
- Hatanın kök nedeninin analizi: Microsoft, otomatik bakım sistemindeki hatanın kaynağını belirlemek için detaylı bir inceleme gerçekleştirmiştir. Bu inceleme sırasında, yazılım güncellemelerinin ve bakım senaryolarının gözden geçirilmesi de dahil edilmiştir.
- Düzeltici eylemlerin uygulanması: Hata düzeltildikten sonra, sistemdeki IP rotaları manuel olarak geri yüklenmiş ve ağ altyapısı yeniden yapılandırılmıştır.
- Otomatik koruma mekanizmalarının güçlendirilmesi: Microsoft, gelecekte benzer olayların yaşanmaması için otomatik bakım sistemine ekstra doğrulama adımları ve onay mekanizmaları eklemiştir. Bu sayede, bakım sırasında yanlışlıkla fazla sayıda rotanın silinmesi engellenmiştir.
- Kullanıcı iletişiminin iyileştirilmesi: Olayın ardından Microsoft, kullanıcılara daha hızlı ve şeffaf bilgi sağlamak amacıyla durum sayfasını ve sosyal medya hesaplarını daha aktif kullanmaya başlamıştır.
Kullanıcıların ve IT Yöneticilerin Alması Gereken Önlemler
Aşağıdaki adımlar, benzer olayların yaşanması durumunda kullanıcıların ve IT yöneticilerin alması gereken önlemleri içermektedir:
- Microsoft 365 Durum Sayfasını Takip Edin:
https://status.office365.comMicrosoft, hizmet kesintilerini ve olası sorunları bu sayfada yayınlamaktadır. IT yöneticileri, bu sayfayı düzenli olarak kontrol ederek kullanıcıları bilgilendirebilir.
- Yedek Bağlantı Seçenekleri Oluşturun:
Uyarı: Kritik iş süreçlerinde Microsoft 365'e bağımlı olan şirketler, yedek internet bağlantıları ve alternatif iletişim kanalları (örneğin, Slack, Zoom) oluşturmalıdır. Bu sayede, Microsoft 365'e erişim kesildiğinde iş süreçleri kesintiye uğramaz.
- Otomatik Bakım Sistemi Ayarlarını Gözden Geçirin:
IT yöneticileri, Microsoft 365 ve Azure hizmetlerinde otomatik bakım sistemlerinin nasıl çalıştığını anlamalı ve gerekirse ayarlarını daha kontrollü bir şekilde yapılandırmalıdır. Örneğin, bakım sırasında IP rotalarının kaldırılması gibi kritik işlemlerin manuel onay gerektirmesi sağlanabilir.
- İzleme ve Uyarı Sistemlerini Kurun:
Azure Monitor ve Microsoft 365 Admin Center gibi araçlar kullanılarak, hizmetlerdeki anormal durumlar tespit edilebilir. Örneğin, ağ trafiğinde ani düşüşler veya hizmet yanıt sürelerinde artış gibi durumlar için otomatik uyarılar oluşturulabilir.
# Azure Monitor üzerinden uyarı oluşturma örneği (Azure CLI) az monitor metrics alert create \ --name "HighResponseTimeAlert" \ --resource-group "Monitoring" \ --scopes "/subscriptions/{subscription-id}/resourceGroups/{resource-group}" \ --condition "avg ResponseTime > 5000" \ --description "Yüksek yanıt süresi uyarısı" \ --evaluation-frequency 5m \ --severity 2
Gelecekte Benzer Olayların Önlenmesi
Microsoft'un bu olaydan çıkardığı dersler, gelecekteki otomatik bakım sistemlerinde önemli değişikliklere yol açmıştır. Bunlar arasında:
- Daha sıkı doğrulama mekanizmaları: Bakım sırasında gerçekleştirilecek işlemlerin çoğul onay gerektirmesi ve kritik sistemlere manuel müdahale seçeneklerinin bulunması sağlanmıştır.
- Simülasyon ve test ortamları: Yeni bakım senaryoları, gerçek ağ ortamına uygulanmadan önce test ortamlarında tam olarak simüle edilmektedir.
- Kullanıcı geri bildirimlerinin değerlendirilmesi: Microsoft, gelecekteki bakım planlarını kullanıcı geri bildirimlerine göre şekillendirmeyi planlamaktadır.
Sonuç
Microsoft'un 30 Kasım 2023 tarihinde yaşanan büyük kesintisi, otomasyon sistemlerindeki bir hata nedeniyle meydana gelmiştir. Bu olay, hem Microsoft'un hem de diğer bulut hizmeti sağlayıcılarının otomasyon sistemlerinde daha sıkı kontrollerin ve doğrulama mekanizmalarının gerekli olduğunu göstermiştir. Kullanıcılar ve IT yöneticileri, benzer olayların etkilerini azaltmak için yedek bağlantılar, izleme sistemleri ve otomatik uyarılar gibi önlemleri almalıdır.
Microsoft'un bu olaydan öğrendikleri, gelecekteki hizmetlerin daha güvenilir ve dayanıklı olmasını sağlayacaktır.



