NVIDIA Mellanox MQM9790-NS2F तकनीकी संदर्भः आरडीएमए/एचपीसी/एआई क्लस्टर के लिए कम विलंबता इंटरकनेक्ट अनुकूलन

August 24, 2026

NVIDIA Mellanox MQM9790-NS2F तकनीकी संदर्भः आरडीएमए/एचपीसी/एआई क्लस्टर के लिए कम विलंबता इंटरकनेक्ट अनुकूलन

NVIDIA Mellanox MQM9790-NS2F तकनीकी संदर्भः आरडीएमए/एचपीसी/एआई क्लस्टर के लिए कम विलंबता इंटरकनेक्ट अनुकूलन

1परियोजना पृष्ठभूमि और आवश्यकताओं का विश्लेषण

आधुनिक एआई प्रशिक्षण और एचपीसी सिमुलेशन वर्कलोड तीव्र, सभी-से-सभी संचार पैटर्न की विशेषता है जो अंतर्निहित नेटवर्क कपड़े पर अत्यधिक मांग करते हैं।जैसा कि GPU क्लस्टर 1 से परे स्केल करते हैंइन वातावरणों से उत्पन्न होने वाली प्रमुख आवश्यकताओं में निम्नलिखित शामिल हैंः

  • निर्धारक अति-कम विलंबताःएमपीआई कार्य पूरा होने के समय को कम करने के लिए सब-माइक्रोसेकंड पोर्ट-टू-पोर्ट विलंबता।
  • हानि रहित कपड़ा:टीसीपी इनकास्ट और प्रदर्शन पतन को रोकने के लिए संकुचन के तहत शून्य पैकेट गिरता है।
  • नेटवर्क में कम्प्यूटिंग लोडःसामूहिक परिचालनों के लिए होस्ट सीपीयू ओवरहेड की कमी (जैसे, सभी को कम करना, प्रसारण) ।
  • स्केलेबल टोपोलॉजीःफॅट-ट्री और ड्रैगनफ्लाई+ टोपोलॉजी के लिए समर्थन, जिसमें हजारों एंडपॉइंट्स तक पूर्ण बाइसक्शन बैंडविड्थ है।

NVIDIA Mellanox MQM9790-NS2Fइन मांगों को पूरा करने के लिए 64 ओएसएफपी पोर्ट के साथ 400Gb/s एनडीआर इन्फिनिबैंड स्विच के रूप में डिज़ाइन किया गया है, जो एक्सास्केल-क्लास तैनाती के लिए आवश्यक घनत्व और प्रदर्शन प्रदान करता है।

2समग्र नेटवर्क आर्किटेक्चर डिजाइन

प्रस्तावित समाधान में दो-स्तरीय पत्ती-पींजर टोपोलॉजी का उपयोग किया गया है, जो स्केलेबिलिटी, ओवरसब्सक्राइब कंट्रोल और केबलिंग सरलता का संतुलन प्रदान करता है।प्रत्येक कंप्यूटिंग रैक में एक या दो घर होते हैंMQM9790-NS2F InfiniBand स्विचGPU सर्वर के लिए 400Gb / s कनेक्टिविटी के 64 पोर्ट प्रदान करते हैं। रीढ़ की परत पर, MQM9790-NS2F स्विच का एक दूसरा स्तर सभी पत्तियों को आपस में जोड़ता है, एक गैर-अवरुद्ध कपड़े का निर्माण करता है।

2,000 GPU नोड्स से अधिक के बड़े पैमाने पर तैनाती के लिए, तीन-स्तरीय फोल्ड-क्लोज आर्किटेक्चर को अपनाया जा सकता है,MQM9790-NS2F 400Gb/s NDR 64-पोर्ट OSFPयह डिजाइन यह सुनिश्चित करता है कि कोई भी सर्वर लाइन दर पर किसी भी अन्य सर्वर के साथ संवाद कर सकता है,अधिकतम तीन स्विच हॉप्स के साथ.

निम्नलिखित तालिका में MQM9790-NS2F के आसपास निर्मित दो-स्तरीय पत्ती-पीठ कपड़े के लिए विशिष्ट स्केलिंग मापदंडों का सारांश दिया गया हैः

घटक विनिर्देश मूल्य
पत्ती स्विच MQM9790-NS2F प्रति रैक 1 ¢ 2 इकाइयाँ
रीढ़ की हड्डी के स्विच MQM9790-NS2F N/2 (जहां N = पत्ती स्विच की संख्या)
अधिकतम समापन बिंदु प्रत्येक कपड़े के लिए GPU सर्वर चार तक,096
द्विभाज्य बैंडविड्थ पूर्ण गैर अवरोधक 51.2 Tb/s प्रति रीढ़ की परत

3. NVIDIA Mellanox MQM9790-NS2F की भूमिका और प्रमुख विशेषताएं

इस वास्तुकला के भीतर,NVIDIA Mellanox MQM9790-NS2Fआधारभूत निर्माण खंड के रूप में कार्य करता है, कई महत्वपूर्ण क्षमताएं प्रदान करता हैः

  • 400Gb/s NDR प्रति पोर्टः64 ओएसएफपी बंदरगाहों में से प्रत्येक विश्वसनीय लंबी दूरी की कनेक्टिविटी के लिए आगे की त्रुटि सुधार (एफईसी) के साथ द्विदिश 400Gb / s का समर्थन करता है।
  • एकीकृत SHARPv3 (स्केलेबल पदानुक्रमित एग्रीगेशन और रिडक्शन प्रोटोकॉल):मेजबान सीपीयू से सामूहिक संचार संचालन को ऑफलोड करता है, बड़े पैमाने पर कार्यों में एमपीआई सभी-कम विलंबता को 40% तक कम करता है।
  • अनुकूली मार्ग और भीड़ नियंत्रण:गतिशील रूप से हॉटस्पॉट से बचने के लिए यातायात को पुनर्निर्देशित करें, विरोधी यातायात पैटर्न के तहत भी पूर्वानुमानित प्रदर्शन सुनिश्चित करें।
  • उन्नत टेलीमेट्री:प्रति-प्रवाह और प्रति-पोर्ट काउंटर, बफर कब्जे की निगरानी के साथ, कपड़े की स्वास्थ्य में गहरी दृश्यता प्रदान करते हैं।

के अनुसारMQM9790-NS2F डेटाशीट, स्विच 100 एनएस से कम कट-थ्रू विलंबता प्रदान करता है और कुल स्विचिंग क्षमता के 51.2 टीबी/सेकंड तक का समर्थन करता है।ये विनिर्देश इसे ग्रीनफील्ड तैनाती और एचडीआर (200Gb/s) बुनियादी ढांचे से चरणबद्ध उन्नयन दोनों के लिए एक आदर्श विकल्प बनाते हैं.

4. तैनाती और स्केलेबिलिटी सिफारिशें

संगठनों के लिए जो इस योजना को अपनाने की योजना बना रहे हैंMQM9790-NS2F InfiniBand स्विच समाधान, निम्नलिखित तैनाती दिशानिर्देशों की सिफारिश की जाती हैः

  • केबलिंग रणनीति:रैक के भीतर कनेक्शन के लिए OSFP-to-OSFP डायरेक्ट-एटैच कॉपर (DAC) केबलों का उपयोग करें (3 मीटर तक) और रैक और रीढ़-पत्ती लिंक के लिए सक्रिय ऑप्टिकल केबल (AOC) या ऑप्टिकल ट्रांससीवर (100 मीटर तक) ।
  • अपर्याप्तता:दोहरी बिजली की आपूर्ति और गर्म-स्वैप करने योग्य प्रशंसक मॉड्यूल तैनात करें। दोष सहिष्णुता के लिए प्रत्येक बिजली की आपूर्ति को अलग-अलग पीडीयू से कनेक्ट करें।
  • फर्मवेयर स्थिरताःसुनिश्चित करें कि सभी स्विच एक ही NVIDIA फर्मवेयर संस्करण चलाते हैं ताकि सुविधा असंगतता से बचा जा सके. रोलिंग अपडेट के लिए UFM की स्वचालित फर्मवेयर अपग्रेड सुविधा का उपयोग करें.
  • स्केलेबिलिटीः4,000 नोड्स से अधिक समूहों के लिए, तीन-स्तरीय तह-बंद टोपोलॉजी या अनुकूलन रूटिंग सक्षम के साथ ड्रैगनफ्लाई + पर विचार करें।MQM9790-NS2F संगतइस पारिस्थितिकी तंत्र में इन टोपोलॉजीज का समर्थन करने के लिए ऑप्टिक्स और केबलों की एक विस्तृत श्रृंखला शामिल है।

स्वामित्व की कुल लागत की गणना करते समय, कम रेडिक्स वाले विकल्पों की तुलना में स्विच स्तरों और सरलीकृत केबलिंग की कम संख्या में कारक।MQM9790-NS2F कीमतप्रति यूनिट पिछले पीढ़ी के स्विच की तुलना में अधिक है, प्रति पोर्ट लागत और प्रति जीपीयू नेटवर्क लागत बड़े पैमाने पर तैनाती में काफी कम है,इसे एक्सास्केल परियोजनाओं के लिए एक लागत प्रभावी विकल्प बनाना.

5संचालन, निगरानी और समस्या निवारण

एनडीआर कपड़े के प्रभावी प्रबंधन के लिए एक व्यापक निगरानी और समस्या निवारण ढांचे की आवश्यकता होती है।NVIDIA Mellanox MQM9790-NS2Fकपड़े के आधार पर, जो निम्नलिखित की पेशकश करते हैंः

  • टोपोलॉजी विज़ुअलाइज़ेशनःसभी स्विच, लिंक और एंडपॉइंट की स्वचालित खोज और ग्राफिकल प्रतिनिधित्व।
  • प्रदर्शन डैशबोर्डःबंदरगाह उपयोग, त्रुटि दर और भीड़भाड़ संकेतकों के वास्तविक समय दृश्य।
  • सक्रिय चेतावनीःलिंक गिरावट, तापमान असामान्यताओं और बिजली आपूर्ति विफलताओं के लिए सीमा आधारित अलार्म।
  • दोष अलगावःनिर्देशित समस्या निवारण कार्यप्रवाह जो दोषपूर्ण केबल, ट्रांससीवर या स्विच पोर्ट की पहचान करते हैं।

उन्नत समस्या निवारण के लिए,MQM9790-NS2F विनिर्देशइसमें विस्तृत बफर निगरानी और प्रवाह स्तर के आँकड़े शामिल हैं जिन्हें REST एपीआई के माध्यम से निर्यात किया जा सकता है ताकि कस्टम निगरानी स्टैक के साथ एकीकरण किया जा सके।नेटवर्क इंजीनियरों को स्विच के अंतर्निहित नैदानिक उपकरणों का भी लाभ उठाना चाहिए, जैसे कि लूपबैक परीक्षण और बीईआर (बिट त्रुटि दर) विश्लेषण, उत्पादन कार्यभारों को तैनात करने से पहले लिंक अखंडता को मान्य करने के लिए।

प्रारंभिक तैनाती के दौरान आम समस्याओं में असमान लिंक गति या असंगत केबल प्रकारों के कारण उप-उपयुक्त रूटिंग शामिल हैं।अनुकूली रूटिंग को सक्षम करना और यह सत्यापित करना कि सभी लिंक 400Gb / s पर काम कर रहे हैं (FEC सक्षम के साथ) अधिकांश प्रदर्शन असामान्यताओं को हल करता है.MQM9790-NS2F InfiniBand स्विच समाधानइसमें सबनेट मैनेजर रिडंडेंसी के लिए भी समर्थन शामिल है, यह सुनिश्चित करता है कि प्रबंधन नोड की विफलता की स्थिति में मैन्युअल हस्तक्षेप के बिना फैब्रिक रीकॉन्फिगरेशन हो सके।

6. सारांश और मूल्य निर्धारण

MQM9790-NS2Fउच्च प्रदर्शन नेटवर्क में एक महत्वपूर्ण प्रगति का प्रतिनिधित्व करता है, जो एक एकल, प्रबंधनीय 1U प्लेटफॉर्म में 400Gb/s NDR बैंडविड्थ, 64-पोर्ट घनत्व और इन-नेटवर्क कंप्यूटिंग त्वरण प्रदान करता है।एआई और एचपीसी क्लस्टर डिजाइन करने वाले वास्तुकारों और इंजीनियरों के लिए, यह स्विच एक्सास्केल प्रदर्शन के लिए एक सिद्ध मार्ग प्रदान करता है, जिससेः

  • 30% तक की कटौतीSHARPv3 के माध्यम से बड़े पैमाने पर प्रशिक्षण कार्यभार के लिए कार्य पूरा करने के समय में।
  • कम टीसीओवैकल्पिक समाधानों की तुलना में, उच्च रेडिक्स और कम स्विच-लेयर की संख्या के कारण।
  • सरलीकृत कार्ययूएफएम एकीकरण और व्यापक टेलीमेट्री के माध्यम से सक्रिय दोष प्रबंधन के लिए।
  • भविष्य के लिए स्केलेबलअगली पीढ़ी के GPU और त्वरक इंटरकनेक्ट का समर्थन करने के लिए।

संगठनों के लिएबिक्री के लिए MQM9790-NS2FNVIDIA के भागीदार नेटवर्क के माध्यम से, हम विस्तृत समीक्षा करने की सलाह देते हैंMQM9790-NS2F डेटाशीटऔर एक प्रमाणित समाधान वास्तुकार के साथ जुड़ना आपके विशिष्ट कार्यभार और पैमाने की आवश्यकताओं के अनुरूप तैनाती के लिए।NVIDIA Mellanox MQM9790-NS2Fवैज्ञानिक खोज और एआई नवाचार के अगले दशक के लिए उच्च प्रदर्शन वाले इंटरकनेक्ट रीढ़ की हड्डी के रूप में सेवा करने के लिए तैयार है।