New Delhi: Microsoft ने 23 जुलाई को Microsoft 365 और Azure सेवाओं को प्रभावित करने वाली वैश्विक आउटेज के पीछे अपनी स्वचालित नेटवर्क मेंटेनेंस प्रणाली में आई तकनीकी खामी को जिम्मेदार ठहराया है। कंपनी के अनुसार, नियमित नेटवर्क रखरखाव के दौरान एक सॉफ्टवेयर बग के कारण निर्धारित संख्या से अधिक नेटवर्क डिवाइसों से IP रूट गलती से हटा दिए गए, जिससे Azure के West US क्षेत्र से जुड़े नेटवर्क ट्रैफिक में व्यापक व्यवधान उत्पन्न हुआ। इसके चलते Microsoft 365, Azure और कई क्लाउड सेवाओं तक ग्राहकों की पहुंच प्रभावित हुई।
कंपनी के अनुसार आउटेज 23 जुलाई को सुबह 10:44 बजे (ET) शुरू हुआ और इसका सबसे अधिक प्रभाव उन ग्राहकों पर पड़ा जो West US Azure क्षेत्र से जुड़े नेटवर्क इंफ्रास्ट्रक्चर के माध्यम से Microsoft 365 सेवाओं का उपयोग कर रहे थे। कुछ ही समय में बड़ी संख्या में उपयोगकर्ताओं ने सेवाएं उपलब्ध न होने, धीमी प्रतिक्रिया और लॉगिन संबंधी समस्याओं की शिकायतें दर्ज कराईं।
Microsoft ने इस घटना को MO1437424 नामक सेवा घटना (Incident) के रूप में ट्रैक किया। प्रभावित सेवाओं में SharePoint Online, Microsoft Teams, OneDrive, Microsoft 365 Admin Center, Power Automate, Copilot Chat और Microsoft Loop शामिल थे। SharePoint उपयोगकर्ताओं को “Something went wrong” जैसे त्रुटि संदेश मिले, जबकि Teams में चैट और चित्र लोड होने में समस्या आई। OneDrive तक पहुंच रुक-रुक कर उपलब्ध रही और कई प्रशासकों को Admin Center तक पहुंचने में कठिनाई का सामना करना पड़ा।
इसके अलावा Power BI, Microsoft Fabric, Power Apps, Copilot Studio, Windows 365 और Microsoft Defender जैसी सेवाएं भी प्रभावित हुईं। कुछ Defender ग्राहकों को सुरक्षा विशेषज्ञों से प्रतिक्रिया मिलने में देरी हुई, जबकि Threat Explorer और Advanced Hunting के माध्यम से शुरू किए गए जांच और रिमेडिएशन कार्य भी असफल रहे। Azure App Service, Azure Kubernetes Service, Azure Cosmos DB, Azure Firewall, ExpressRoute, Microsoft Sentinel, Virtual WAN और VPN Gateway सहित कई Azure सेवाओं में भी कनेक्टिविटी और प्रदर्शन संबंधी समस्याएं दर्ज की गईं।
शुरुआती चरण में Microsoft ने वैकल्पिक नेटवर्क मार्गों के माध्यम से ट्रैफिक को पुनर्निर्देशित कर प्रभाव कम करने का प्रयास किया, लेकिन इससे केवल आंशिक राहत मिली। जांच के दौरान कंपनी ने पाया कि हाल ही में किए गए नेटवर्क परिवर्तन के दौरान स्वचालित अनुरोध रूपांतरण प्रणाली ने अतिरिक्त नेटवर्क डिवाइसों को भी मेंटेनेंस प्रक्रिया का हिस्सा मान लिया। इसके परिणामस्वरूप West US डेटा सेंटर और Microsoft के वाइड एरिया नेटवर्क (WAN) के बीच अपेक्षा से कहीं अधिक IP रूट हटा दिए गए, जिससे क्षेत्र में आने-जाने वाला नेटवर्क ट्रैफिक बाधित हो गया। हालांकि, West US क्षेत्र के भीतर संचालित आंतरिक ट्रैफिक पर इसका प्रभाव नहीं पड़ा।
इंजीनियरों ने समस्या की पहचान के बाद दोपहर 1:45 बजे (ET) मेंटेनेंस परिवर्तन को वापस लेना शुरू किया और 2:26 बजे तक रोलबैक पूरा कर लिया। इसके बाद प्रभावित नेटवर्क इंफ्रास्ट्रक्चर धीरे-धीरे सामान्य होने लगा। Microsoft ने सेवा टेलीमेट्री और ग्राहकों से प्राप्त जानकारी के आधार पर पुष्टि की कि Microsoft 365 सेवाएं बहाल हो गई हैं, जबकि कुछ Azure सेवाओं की रिकवरी में अतिरिक्त समय लगा। कंपनी के अनुसार सभी प्रभावित सेवाएं शाम 3:41 बजे (ET) तक पूरी तरह सामान्य हो चुकी थीं।
Algoritha Security के एक शोधकर्ता के अनुसार, बड़े क्लाउड प्लेटफॉर्म पर स्वचालित मेंटेनेंस प्रणालियां संचालन को तेज और प्रभावी बनाती हैं, लेकिन यदि उनमें मौजूद सुरक्षा जांच या सत्यापन प्रक्रिया में तकनीकी खामी रह जाए तो उसका प्रभाव लाखों उपयोगकर्ताओं तक पहुंच सकता है। ऐसे वातावरण में मल्टी-लेयर वैलिडेशन, चरणबद्ध रोलआउट और स्वतः रोलबैक जैसी व्यवस्थाएं सेवा व्यवधान के जोखिम को काफी हद तक कम कर सकती हैं।
Microsoft ने कहा है कि वह इस घटना की विस्तृत आंतरिक समीक्षा कर रहा है, जिसमें स्वचालित मेंटेनेंस अनुरोध प्रणाली, सुरक्षा जांच और परिवर्तन प्रबंधन प्रक्रिया का व्यापक विश्लेषण किया जाएगा। कंपनी का कहना है कि जांच पूरी होने के बाद लगभग 14 दिनों के भीतर अंतिम पोस्ट-इंसिडेंट समीक्षा रिपोर्ट जारी की जाएगी, ताकि भविष्य में ऐसी घटनाओं की पुनरावृत्ति रोकी जा सके और क्लाउड सेवाओं की विश्वसनीयता को और मजबूत बनाया जा सके।
