NVIDIA Mellanox 920-9B110-00FH-0D0 तकनीकी संदर्भ: RDMA/HPC/AI के लिए अनुकूलित लो-लेटेंसी इंटरकनेक्ट

August 25, 2026

NVIDIA Mellanox 920-9B110-00FH-0D0 तकनीकी संदर्भ: RDMA/HPC/AI के लिए अनुकूलित लो-लेटेंसी इंटरकनेक्ट

NVIDIA Mellanox 920-9B110-00FH-0D0 तकनीकी संदर्भ: 200Gb/s HDR पर RDMA/HPC/AI क्लस्टर के लिए अनुकूलित निम्न-विलंबता इंटरकनेक्ट

1. परियोजना पृष्ठभूमि और आवश्यकता विश्लेषण

जैसे-जैसे HPC और AI क्लस्टर का पैमाना बढ़ता जा रहा है, वितरित प्रशिक्षण और वैज्ञानिक सिमुलेशन वर्कलोड के लिए नेटवर्क बैंडविड्थ, विलंबता और स्केलेबिलिटी की बढ़ती मांगें हैं। हालांकि, हर क्लस्टर को 400Gb/s NDR इंफ्रास्ट्रक्चर की आवश्यकता नहीं होती है - उत्पादन वातावरण की एक बड़ी संख्या पहले से ही 200Gb/s HDR पर मानकीकृत है और एक नियंत्रित बजट के भीतर प्रदर्शन सुधार की तलाश में है। विशिष्ट आवश्यकताओं में शामिल हैं:

  • निर्धारित निम्न विलंबता: MPI सामूहिक संचार को प्रशिक्षण अभिसरण को प्रभावित करने वाली टेल विलंबता को रोकने के लिए सब-माइक्रोसेकंड पोर्ट-टू-पोर्ट विलंबता बनाए रखनी चाहिए।
  • हानिरहित फ़ैब्रिक: RDMA दक्षता सुनिश्चित करने और प्रदर्शन पतन से बचने के लिए भीड़ के तहत शून्य पैकेट ड्रॉप।
  • इन-नेटवर्क कंप्यूट ऑफ़लोड: होस्ट CPU/GPU संसाधनों को मुक्त करने के लिए नेटवर्क फ़ैब्रिक पर ऑल-रिड्यूस जैसे सामूहिक संचालन को ऑफ़लोड करना।
  • सहज स्केलेबिलिटी: मौजूदा HDR केबल और ऑप्टिकल ट्रांसीवर के साथ संगतता के साथ, सैकड़ों से हजारों नोड्स तक गैर-अवरुद्ध विस्तार के लिए समर्थन।

इन आवश्यकताओं को पूरा करने के लिए, यह समाधान कोर बिल्डिंग ब्लॉक के रूप में NVIDIA Mellanox 920-9B110-00FH-0D0 को अपनाता है - एक 200Gb/s HDR InfiniBand स्विच जो मध्यम से बड़े पैमाने पर तैनाती के लिए प्रदर्शन, घनत्व और लागत-प्रभावशीलता को संतुलित करता है।

2. समग्र नेटवर्क वास्तुकला डिजाइन

प्रस्तावित समाधान दो-स्तरीय लीफ-स्पाइन टोपोलॉजी को नियोजित करता है, जो अनुमानित विलंबता और सरलीकृत केबलिंग के साथ एक स्केलेबल, गैर-अवरुद्ध फ़ैब्रिक प्रदान करता है। लीफ परत पर, प्रत्येक कंप्यूट रैक एक 920-9B110-00FH-0D0 InfiniBand स्विच OPN (ऑर्डरिंग पार्ट नंबर) से सुसज्जित है, जो OSFP-to-OSFP डायरेक्ट-अटैच कॉपर (DAC) या एक्टिव ऑप्टिकल केबल (AOC) के माध्यम से GPU सर्वर के लिए 200Gb/s HDR कनेक्टिविटी के 40 पोर्ट प्रदान करता है। स्पाइन परत पर, MQM8790-HS2F स्विच की दूसरी परत - 920-9B110-00FH-0D0 MQM8790-HS2F 200Gb/s HDR के अंतर्निहित सिलिकॉन प्लेटफ़ॉर्म - सभी लीफ स्विच को इंटरकनेक्ट करता है, एक पूर्ण-बाइसेक्शन-बैंडविड्थ फैट-ट्री फ़ैब्रिक बनाता है।

1,500 नोड्स से अधिक बड़े क्लस्टर के लिए, एक तीन-स्तरीय फोल्डेड-क्लॉस आर्किटेक्चर लागू किया जा सकता है, जिसमें 920-9B110-00FH-0D0 लीफ और स्पाइन दोनों के रूप में कार्य करता है ताकि सभी स्तरों पर लगातार प्रदर्शन बनाए रखा जा सके। निम्नलिखित तालिका इस स्विच के आसपास निर्मित 2-स्तरीय HDR फ़ैब्रिक के लिए प्रमुख स्केलिंग मापदंडों को सारांशित करती है:

घटक विनिर्देश मान
लीफ स्विच 920-9B110-00FH-0D0 प्रति रैक 1
स्पाइन स्विच 920-9B110-00FH-0D0 N/2 (N = लीफ स्विच की संख्या)
अधिकतम एंडपॉइंट GPU सर्वर 1,600 तक (40-पोर्ट रेडिक्स)
बाइसेक्शन बैंडविड्थ पूर्ण गैर-अवरुद्ध प्रति स्पाइन टियर 8.0 टीबी/एस

3. NVIDIA Mellanox 920-9B110-00FH-0D0 की भूमिका और मुख्य विशेषताएं

इस वास्तुकला के भीतर, NVIDIA Mellanox 920-9B110-00FH-0D0 मूलभूत स्विचिंग तत्व के रूप में कार्य करता है, जो कई महत्वपूर्ण क्षमताएं प्रदान करता है:

  • 200Gb/s HDR के 40 पोर्ट: प्रत्येक OSFP पोर्ट विश्वसनीय विस्तारित-पहुंच कनेक्टिविटी के लिए फॉरवर्ड एरर करेक्शन (FEC) के साथ द्विदिश 200Gb/s का समर्थन करता है।
  • एकीकृत SHARPv2 (स्केलेबल हायरार्किकल एग्रीगेशन एंड रिडक्शन प्रोटोकॉल): सामूहिक संचार संचालन को ऑफ़लोड करता है, विशिष्ट HPC वर्कलोड में MPI ऑल-रिड्यूस विलंबता को 30% तक कम करता है।
  • अनुकूली रूटिंग और भीड़ नियंत्रण: हॉटस्पॉट से बचने के लिए यातायात को गतिशील रूप से पुनर्निर्देशित करता है, प्रतिकूल यातायात पैटर्न के तहत अनुमानित प्रदर्शन सुनिश्चित करता है।
  • उन्नत टेलीमेट्री: प्रति-प्रवाह और प्रति-पोर्ट काउंटर, बफर अधिभोग निगरानी के साथ, फ़ैब्रिक स्वास्थ्य में गहरी दृश्यता प्रदान करते हैं।

के अनुसार, 920-9B110-00FH-0D0 डेटाशीट, स्विच सब-200ns कट-थ्रू विलंबता प्रदान करता है और 8.0 टीबी/एस तक कुल स्विचिंग क्षमता का समर्थन करता है। 920-9B110-00FH-0D0 विनिर्देश मिशन-महत्वपूर्ण वर्कलोड के लिए 99.999% उपलब्धता सुनिश्चित करते हुए, दोहरे-अतिरिक्त बिजली आपूर्ति और हॉट-स्वैपेबल फैन मॉड्यूल को भी उजागर करते हैं।

4. परिनियोजन और स्केलेबिलिटी सिफारिशें

उन संगठनों के लिए जो 920-9B110-00FH-0D0 InfiniBand स्विच OPN समाधान को अपनाने की योजना बना रहे हैं, निम्नलिखित परिनियोजन दिशानिर्देशों की सिफारिश की जाती है:

  • केबलिंग रणनीति: इंट्रा-रैक कनेक्शन (3 मीटर तक) के लिए OSFP-to-OSFP DAC केबल और इंटर-रैक और स्पाइन-लीफ लिंक (100 मीटर तक) के लिए AOC या ऑप्टिकल ट्रांसीवर का उपयोग करें। सत्यापित करें कि सभी केबल NVIDIA संगतता मैट्रिक्स के अनुसार 920-9B110-00FH-0D0 संगत हैं।
  • अतिरिक्तता: अलग-अलग पी डी यू से जुड़े दोहरे बिजली आपूर्ति को तैनात करें। विफलता के एकल बिंदुओं को खत्म करने के लिए प्रति लीफ कम से कम दो स्पाइन स्विच का उपयोग करें।
  • फर्मवेयर प्रबंधन: सुनिश्चित करें कि सभी स्विच समान NVIDIA फर्मवेयर संस्करण चलाते हैं। डाउनटाइम के बिना रोलिंग अपडेट के लिए UFM की स्वचालित फर्मवेयर अपग्रेड सुविधा का उपयोग करें।
  • स्केलेबिलिटी पथ: 1,600 नोड्स से परे क्लस्टर के लिए, तीन-स्तरीय फोल्डेड-क्लॉस टोपोलॉजी में संक्रमण करें या अनुकूली रूटिंग के साथ ड्रैगनफ्लाई+ का लाभ उठाएं। 920-9B110-00FH-0D0 एक एकल सबनेट प्रबंधक के तहत एक एकल फ़ैब्रिक में 64 स्विच तक का समर्थन करता है।

कुल स्वामित्व लागत की गणना करते समय, कम रेडिक्स विकल्पों की तुलना में स्विच टियर की कम संख्या और सरलीकृत केबलिंग को ध्यान में रखें। जबकि 920-9B110-00FH-0D0 मूल्य प्रति यूनिट EDR (100Gb/s) स्विच की तुलना में अधिक है, प्रति-पोर्ट लागत NDR की तुलना में काफी कम है, जो इसे लागत-जागरूक HDR तैनाती के लिए एक इष्टतम विकल्प बनाता है।

5. संचालन, निगरानी और समस्या निवारण

HDR फ़ैब्रिक के प्रभावी प्रबंधन के लिए एक व्यापक निगरानी और समस्या निवारण ढांचे की आवश्यकता होती है। NVIDIA का यूनिफाइड फैब्रिक मैनेजर (UFM) पूरे NVIDIA Mellanox 920-9B110-00FH-0D0-आधारित फ़ैब्रिक के लिए एक एकल ग्लास पैन प्रदान करता है, जो प्रदान करता है:

  • टोपोलॉजी विज़ुअलाइज़ेशन: सभी स्विच, लिंक और एंडपॉइंट की स्वचालित खोज और ग्राफिकल प्रतिनिधित्व।
  • प्रदर्शन डैशबोर्ड: पोर्ट उपयोग, त्रुटि दर और भीड़ संकेतक के वास्तविक समय दृश्य।
  • सक्रिय अलर्टिंग: लिंक गिरावट, तापमान विसंगतियों और बिजली आपूर्ति विफलताओं के लिए थ्रेशोल्ड-आधारित अलार्म।
  • दोष अलगाव: दोषपूर्ण केबल, ट्रांसीवर, या स्विच पोर्ट की पहचान करने वाले निर्देशित समस्या निवारण वर्कफ़्लो।

उन्नत समस्या निवारण के लिए, उत्पादन वर्कलोड को तैनात करने से पहले लिंक अखंडता को मान्य करने के लिए लूपबैक परीक्षण और बीईआर (बिट त्रुटि दर) विश्लेषण सहित स्विच के अंतर्निहित नैदानिक ​​उपकरणों का लाभ उठाएं। शुरुआती तैनाती में आम तौर पर सामना की जाने वाली समस्याओं में असमान लिंक गति या बेमेल केबल प्रकारों के कारण उप-इष्टतम रूटिंग शामिल है। अनुकूली रूटिंग को सक्षम करना और यह सत्यापित करना कि सभी लिंक 200Gb/s (FEC सक्षम के साथ) पर चल रहे हैं, प्रदर्शन विसंगतियों के बहुमत को हल करता है। 920-9B110-00FH-0D0 InfiniBand स्विच OPN प्रबंधन नोड विफलता की स्थिति में फ़ैब्रिक पुनर्संरचना बिना किसी मैन्युअल हस्तक्षेप के हो, यह सुनिश्चित करते हुए अतिरिक्त सबनेट प्रबंधक कॉन्फ़िगरेशन का भी समर्थन करता है।

6. सारांश और मूल्य मूल्यांकन

920-9B110-00FH-0D0 HDR-आधारित HPC और AI क्लस्टर बनाने या विस्तारित करने वाले संगठनों के लिए एक सम्मोहक मूल्य प्रस्ताव प्रदान करता है। यह 40Gb/s HDR के 200 पोर्ट सब-200ns विलंबता, SHARPv2 ऑफ़लोड और एंटरप्राइज़-ग्रेड प्रबंधनीयता के साथ प्रदान करता है - सभी एक लागत-प्रभावी 1U प्लेटफ़ॉर्म में। मुख्य मूल्य बिंदु में शामिल हैं:

  • प्रदर्शन: SHARPv2 ऑफ़लोडिंग और अनुकूली रूटिंग के माध्यम से संचार-गहन वर्कलोड के लिए जॉब पूर्णता समय में 35% तक की कमी।
  • लागत दक्षता: NDR विकल्पों की तुलना में कम TCO, प्रति-पोर्ट लागत HDR-स्केल तैनाती के लिए अनुकूलित है।
  • परिचालन सरलता: एकीकृत प्रबंधन, सक्रिय निगरानी और स्वचालित फेलओवर के लिए UFM के साथ गहरा एकीकरण।
  • निवेश संरक्षण: मौजूदा HDR केबल, ऑप्टिक्स और सॉफ़्टवेयर स्टैक के साथ पूर्ण संगतता, उत्पादन को बाधित किए बिना चरणबद्ध अपग्रेड को सक्षम करना।

उन संगठनों के लिए जो 920-9B110-00FH-0D0 बिक्री के लिए का मूल्यांकन कर रहे हैं NVIDIA के चैनल भागीदारों के माध्यम से, हम विस्तृत 920-9B110-00FH-0D0 डेटाशीट की समीक्षा करने और अपने विशिष्ट वर्कलोड और स्केल आवश्यकताओं के लिए डिज़ाइन को मान्य करने के लिए एक प्रमाणित समाधान आर्किटेक्ट के साथ जुड़ने की सलाह देते हैं। NVIDIA Mellanox 920-9B110-00FH-0D0 आज उत्पादन के लिए तैयार है, जो HPC और AI नवाचार की अगली पीढ़ी के लिए एक संतुलित, उच्च-प्रदर्शन इंटरकनेक्ट नींव प्रदान करता है।