अभ्यास में NVIDIA Mellanox 920-9B210-00FN-0D0: ट्रिलियन-पैरामीटर एमओई मॉडल के लिए एनडीआर कम विलंबता कपड़े का निर्माण

August 27, 2026

के बारे में नवीनतम कंपनी की खबर अभ्यास में NVIDIA Mellanox 920-9B210-00FN-0D0: ट्रिलियन-पैरामीटर एमओई मॉडल के लिए एनडीआर कम विलंबता कपड़े का निर्माण

NVIDIA Mellanox 920-9B210-00FN-0D0 व्यवहार में: ट्रिलियन-पैरामीटर MoE मॉडल के लिए NDR लो-लेटेंसी फैब्रिक का निर्माण

पृष्ठभूमि और चुनौती: जब ऑल-टू-ऑल ट्रेनिंग बॉटलनेक बन जाता है

एक प्रमुख AI अनुसंधान संगठन ने हाल ही में अपने बड़े भाषा मॉडल प्रशिक्षण क्लस्टर को 1,024 से 4,096 NVIDIA H100 GPUs तक बढ़ाया, जिसका महत्वाकांक्षी लक्ष्य 1.8-ट्रिलियन-पैरामीटर स्पार्स MoE (मिक्सचर ऑफ एक्सपर्ट्स) मॉडल के प्रशिक्षण समय को महीनों से घटाकर दो सप्ताह से कम करना था। हालांकि, प्रारंभिक सत्यापन के दौरान, टीम ने पाया कि उनका मौजूदा 200Gb/s HDR नेटवर्क ऑल-टू-ऑल संचार चरण के दौरान गंभीर भीड़ का अनुभव कर रहा था - जो MoE आर्किटेक्चर का एक विशिष्ट पैटर्न है - जिससे GPU उपयोगिता अपेक्षित 85% से घटकर केवल 52% रह गई, जो उनकी प्रशिक्षण समय सीमा को पूरा करने के लिए आवश्यक सीमा से बहुत कम है।

नेटवर्क विश्लेषण से पता चला कि ऑल-टू-ऑल कलेक्टिव कम्युनिकेशन MoE मॉडल के संचार फुटप्रिंट के 40% से अधिक के लिए जिम्मेदार था, और जैसे-जैसे विशेषज्ञों की संख्या बढ़ी, ट्रैफिक पैटर्न तेजी से खंडित और बर्स्टी हो गया। मौजूदा HDR नेटवर्क, कंजेशन कंट्रोल मैकेनिज्म को ट्रिगर करने के बाद, टेल लेटेंसी में भारी वृद्धि का अनुभव हुआ, जिससे GPU का एक महत्वपूर्ण हिस्सा निष्क्रिय और प्रतीक्षा में रह गया। संगठन को एक ऐसे नेटवर्क फैब्रिक की तत्काल आवश्यकता थी जो नियतात्मक सब-माइक्रोसेकंड लेटेंसी, लॉसलेस ट्रांसपोर्ट और बड़े पैमाने पर नॉन-ब्लॉकिंग स्केलेबिलिटी प्रदान कर सके - और 920-9B210-00FN-0D0 को विशेष रूप से इस चुनौती के लिए बनाया गया था।

समाधान और परिनियोजन: एक MoE-अनुकूलित NDR लीफ-स्पाइन आर्किटेक्चर

संगठन ने 920-9B210-00FN-0D0 InfiniBand स्विच OPN के आसपास निर्मित दो-स्तरीय लीफ-स्पाइन फैब्रिक तैनात किया। प्रत्येक कंप्यूट रैक में, लीफ लेयर पर दो 920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR स्विच तैनात किए गए थे, जो OSFP-से-OSFP एक्टिव ऑप्टिकल केबल के माध्यम से 64 डुअल-पोर्ट H100 सर्वर को 400Gb/s कनेक्टिविटी प्रदान करते थे। स्पाइन लेयर पर, 16 अतिरिक्त 920-9B210-00FN-0D0 स्विच ने सभी लीफ स्विच को इंटरकनेक्ट किया, जिससे 51.2 टीबी/एस की कुल बाईसेक्शन बैंडविड्थ के साथ एक पूरी तरह से नॉन-ब्लॉकिंग फैट-ट्री फैब्रिक बनाया गया।

इस समाधान का मुख्य आकर्षण स्विच की एकीकृत SHARPv3 (स्केलेबल हायरार्किकल एग्रीगेशन एंड रिडक्शन प्रोटोकॉल) तकनीक है। MoE वर्कलोड के लिए, ऑल-टू-ऑल संचार को सीधे स्विच फैब्रिक पर ऑफलोड किया गया था, जिसमें स्विच इन-नेटवर्क डेटा रिडक्शन और रीडिस्ट्रीब्यूशन कर रहे थे। इसने कई होस्ट-साइड पास की आवश्यकता को समाप्त कर दिया, जिससे पिछले HDR परिनियोजन को प्रभावित करने वाले संचार ओवरहेड में काफी कमी आई। 920-9B210-00FN-0D0 डेटाशीट 100ns से कम कट-थ्रू लेटेंसी को उजागर करती है, जिसे प्रूफ-ऑफ-कॉन्सेप्ट चरण के दौरान मान्य किया गया था और MoE वर्कलोड की सख्त लेटेंसी आवश्यकताओं के लिए महत्वपूर्ण साबित हुआ।

आगे देखते हुए, संगठन अगले 18 महीनों के भीतर 8,192 GPUs तक विस्तार करने की योजना बना रहा है, NVIDIA के चैनल भागीदारों के माध्यम से बिक्री के लिए - जिसमें डुअल-रिडंडेंट पावर सप्लाई और हॉट-स्वैपेबल फैन शामिल हैं - ने टीम को उनके 99.999% उपलब्धता लक्ष्य को प्राप्त करने में विश्वास दिलाया। इंजीनियरिंग टीम ने यह भी पुष्टि की कि 920-9B210-00FN-0D0 संगत इकोसिस्टम में वे सभी OSFP ऑप्टिक्स और केबल शामिल थे जिन्हें उन्होंने पहले ही योग्य बना लिया था, जिससे खरीद में देरी समाप्त हो गई और परिनियोजन समयरेखा सरल हो गई।परिणाम और मापने योग्य लाभ: बॉटलनेक से इनेबलर तक

NDR फैब्रिक के पूरी तरह से तैनात होने और MoE प्रशिक्षण कार्य को फिर से शुरू करने के बाद, संगठन ने कई आयामों में परिवर्तनकारी सुधारों को मापा:

GPU उपयोगिता रिकवरी:

  • नेटवर्क-प्रेरित स्टॉल को समाप्त करने के प्रत्यक्ष परिणाम के रूप में, औसत GPU उपयोगिता 52% से बढ़कर 89% हो गई, जिसमें पीक उपयोगिता कंप्यूट-इंटेंसिव चरणों के दौरान 94% तक पहुंच गई।ऑल-टू-ऑल लेटेंसी में कमी:
  • 4,096 GPUs में पूर्ण ऑल-टू-ऑल एक्सचेंज के लिए आवश्यक समय 180ms से घटकर 45ms से कम हो गया, जो 75% का सुधार है जो सीधे तेज प्रशिक्षण पुनरावृति में तब्दील हुआ।कार्य पूर्णता समय:
  • 1.8T MoE मॉडल के लिए अनुमानित प्रशिक्षण समय को 14 दिनों से घटाकर केवल 9 दिन कर दिया गया - 36% का त्वरण जिसने टाइम-टू-मार्केट और क्लाउड कंप्यूट लागत दोनों को काफी कम कर दिया।परिचालन दक्षता:
  • प्रति स्विच 64 पोर्ट के साथ, 40-पोर्ट HDR डिज़ाइन की तुलना में आवश्यक स्पाइन स्विच की संख्या में 37% की कमी आई, जिससे केबलिंग सरल हो गई और प्रति रैक बिजली की खपत में 28% की कमी आई।कुल स्वामित्व लागत के दृष्टिकोण से, संगठन की वित्त टीम ने नोट किया कि जबकि

920-9B210-00FN-0D0 मूल्य प्रति यूनिट HDR विकल्पों की तुलना में अधिक था, प्रति-GPU नेटवर्किंग लागत वास्तव में उच्च रेडिक्स और कम स्विच-लेयर गणना के कारण कम हो गई। यह आर्थिक लाभ, नाटकीय प्रदर्शन लाभ के साथ मिलकर, NDR अपग्रेड को एक स्पष्ट व्यावसायिक जीत बनाता है। 920-9B210-00FN-0D0 InfiniBand स्विच OPN समाधान उनके मौजूदा NVIDIA UFM परिनियोजन के साथ भी निर्बाध रूप से एकीकृत हुआ, जिससे केंद्रीकृत दृश्यता और स्वचालित अलर्टिंग प्रदान की गई जिसने परिचालन ओवरहेड को 40% कम कर दिया।सारांश और आउटलुक: अगली पीढ़ी के MoE वर्कलोड के लिए NDR फाउंडेशन

NVIDIA Mellanox 920-9B210-00FN-0D0 इस AI अनुसंधान संगठन के लिए एक परिवर्तनकारी समाधान साबित हुआ, जिसे अपने 4,096-GPU H100 क्लस्टर की पूरी क्षमता को अनलॉक करने की आवश्यकता थी। 400Gb/s NDR बैंडविड्थ, 64-पोर्ट घनत्व और SHARPv3 इन-नेटवर्क कंप्यूटिंग प्रदान करके, स्विच ने उन्हें प्रदर्शन या प्रबंधनीयता से समझौता किए बिना 1,024 से 4,096 GPUs तक स्केल करने में सक्षम बनाया - एक ऐसी उपलब्धि जो उनके पिछले HDR बुनियादी ढांचे के साथ असंभव होती।

आगे देखते हुए, संगठन अगले 18 महीनों के भीतर 8,192 GPUs तक विस्तार करने की योजना बना रहा है, NVIDIA के चैनल भागीदारों के माध्यम से बिक्री के लिए 920-9B210-00FN-0D0 का लाभ उठाकर एक और भी बड़ा तीन-स्तरीय फोल्डेड-क्लोस फैब्रिक बनाएगा। अगली पीढ़ी के AI और HPC नेटवर्किंग निवेशों का मूल्यांकन करने वाले संगठनों के लिए, 920-9B210-00FN-0D0 एक सिद्ध, उत्पादन-तैयार समाधान प्रदान करता है जो एक्सस्केल पर लो-लेटेंसी RDMA इंटरकनेक्ट ऑप्टिमाइज़ेशन के वादे को पूरा करता है।