कार्य में NVIDIA Mellanox MCX623106AN-CDAT सर्वर एडाप्टर।

July 22, 2026

के बारे में नवीनतम कंपनी की खबर कार्य में NVIDIA Mellanox MCX623106AN-CDAT सर्वर एडाप्टर।

कार्य में NVIDIA Mellanox MCX623106AN-CDAT सर्वर एडाप्टर।

पृष्ठभूमि और चुनौतीः जब 200GbE एआई स्केलिंग दीवार से मिलता है

एक तेजी से बढ़ते एआई अनुसंधान संगठन - चलो उन्हें "डीपकोर लैब्स" कहते हैं - एक महत्वपूर्ण स्केलिंग की बाधा का सामना कर रहा था। उनके प्रमुख बड़े भाषा मॉडल प्रशिक्षण समूह,जिसमें 512 NVIDIA H100 GPU 128 नोड्स पर वितरित हैं, गंभीर प्रदर्शन गिरावट का अनुभव कर रहा था क्योंकि वे 64 नोड्स से परे स्केल कर रहे थे। समस्या कंप्यूटिंग या मेमोरी नहीं थी, लेकिन नेटवर्क कपड़े।सभी कम सिंक्रनाइज़ेशन ढाल प्रति पुनरावृत्ति 15 सेकंड से अधिक ले रहे थे, और नेटवर्क स्टॉल के कारण GPU उपयोग केवल 62% तक गिर गया था। उनके मौजूदा 100GbE बुनियादी ढांचे, सॉफ्टवेयर आधारित टीसीपी/आईपी पर निर्भर, बस फटा हुआ संभाल नहीं सकता था,वितरण प्रशिक्षण के विलंबता-संवेदनशील संचार पैटर्नटीम को एक ऐसे समाधान की आवश्यकता थी जो माइक्रोसेकंड स्तर के निर्धारक विलंबता के साथ लाइन दर 200GbE थ्रूपुट प्रदान कर सके।

उनके मूल्यांकन ने उन्हेंNVIDIA Mellanox MCX623106AN-CDATएक 200GbE सर्वर एडाप्टर जिसे सबसे अधिक मांग वाले एआई और एचपीसी वर्कलोड के लिए डिज़ाइन किया गया है।MCX623106AN-CDAT कनेक्टएक्स एडाप्टर PCIe नेटवर्क कार्डउन्नत ऑफलोड और GPUDirect क्षमताओं की पेशकश की जो नेटवर्क की बाधा को समाप्त करने और GPU उपयोग को अधिकतम करने के लिए आवश्यक हैं।

समाधानः MCX623106AN-CDAT ईथरनेट एडाप्टर कार्ड को तैनात करना

DeepCore Labs नेMCX623106AN-CDAT ईथरनेट एडाप्टर कार्डसभी 128 प्रशिक्षण नोड्स में, प्रत्येक सर्वर एक दोहरी-पोर्ट QSFP112 एडाप्टर से लैस है जो NVIDIA स्पेक्ट्रम-4 स्विच पर निर्मित पत्ती-पींजर कपड़े से जुड़ा है।इस तैनाती ने एडेप्टर के मूल RoCE v2 समर्थन का लाभ उठाया ताकि नुकसान रहित ईथरनेट परिवहन संभव हो सके, एक अलग InfiniBand कपड़े की आवश्यकता को समाप्त कर दिया। समाधान की कुंजी एडेप्टर की GPUDirect RDMA क्षमता थी,जो सीपीयू हस्तक्षेप के बिना नेटवर्क पर जीपीयू के बीच प्रत्यक्ष डेटा आंदोलन को सक्षम करता है .

टीम ने स्विच स्तर पर पीएफसी (प्राथमिकता प्रवाह नियंत्रण) और ईसीएन (स्पष्ट भीड़ सूचना) को कॉन्फ़िगर किया,सामूहिक संचार यातायात के लिए प्राथमिकता 3 और भंडारण I/O के लिए प्राथमिकता 4 को समर्पित करना. वे भी गतिशील रूप से कई रास्तों पर यातायात वितरित करने के लिए एनवीडिया के अनुकूली रूटिंग प्रौद्योगिकी को लागू किया, कम से कम हॉटस्पॉट. चार सप्ताह के भीतर,पूरे प्रशिक्षण कपड़े आरडीएमए पर चल रहा था, सभी 512 GPUs RoCE पर निर्बाध रूप से संवाद के साथ।MCX623106AN-CDAT संगतपारिस्थितिकी तंत्र को मजबूत साबित किया गया ✓ कार्ड बिना किसी संशोधन के H100 आधारित सर्वर और NVIDIA के NCCL (NVIDIA Collective Communications Library) के साथ त्रुटिहीन रूप से एकीकृत थे।

टीम ने संदर्भ दियाMCX623106AN-CDAT डेटाशीटबफर आवंटन और भीड़ नियंत्रण मापदंडों को ठीक से समायोजित करने के लिए,अपने मिश्रित कार्यभार वातावरण के लिए इष्टतम प्रदर्शन प्राप्त करना, जिसमें सिंक्रोनस प्रशिक्षण (सभी-कम से अधिक वर्चस्व) और असिंक्रोनस चेकपॉइंटिंग दोनों शामिल थे।.

मापने योग्य परिणामः स्केलिंग दक्षता, थ्रूपुट और जीपीयू उपयोग

आरडीएमए के साथ आरओसीई के माध्यम से सक्षम किया गयाNVIDIA Mellanox MCX623106AN-CDAT, पूरी तरह से कम सिंक्रनाइज़ेशन विलंबता प्रति पुनरावृत्ति औसतन 15.2 सेकंड से घटकर केवल 1.8 सेकंड हो गई ∙ एक 8.4 गुना सुधार। यह सीधे तेजी से मॉडल अभिसरण में अनुवादित हुआःउनके 70B-पैरामीटर मॉडल के लिए प्रशिक्षण का कुल समय 42 दिनों से घटकर 19 दिन हो गया है।, अपने अनुसंधान चक्र में 50% से अधिक की तेजी लाना।

जीपीयू उपयोग, जो नेटवर्क स्टॉल्स के कारण 62% पर रहा था, अपग्रेड के बाद 94% पर पहुंच गया ≈ प्रभावी कंप्यूटिंग क्षमता में 52% का सुधार।एडेप्टर के उन्नत आउट-ऑफ-ऑर्डर डेटा प्लेसमेंट और पैकेट पेसिंग ने सूक्ष्म-बर्स्ट को समाप्त कर दिया जो पूंछ विलंबता स्पाइक्स का कारण बन रहे थे, सभी नोड्स में लगातार प्रदर्शन सुनिश्चित करना।

प्रशिक्षण प्रदर्शन के अलावा, सर्वर थ्रूपुट लाभ भी समान रूप से सम्मोहक थे। हार्डवेयर ऑफलोड इंजनऔर आरओसीई त्वरण सभी नोड्स में नेटवर्क प्रसंस्करण के लिए सीपीयू उपयोग को 38% से घटाकर 4% से कमइसने डेटा प्रीप्रोसेसिंग, चेकपॉइंट संपीड़न और अन्य सहायक कार्यों के लिए महत्वपूर्ण सीपीयू क्षमता को मुक्त कर दिया जो पहले प्रतिबंधित थे।

मीट्रिक पहले (लेगेसी 100GbE एनआईसी) के बाद (MCX623106AN-CDAT) सुधार
ऑल-रिड्यूस लेटेन्सी (प्रति पुनरावृत्ति) 15.2 सेकंड 1.8 सेकंड 8.4 गुना तेज़
GPU उपयोग 62% 94% 52% अधिक
मॉडल प्रशिक्षण समय (70B पैरामीटर) 42 दिन 19 दिन 55% तेज़
सीपीयू नेटवर्क ओवरहेड 38% < 4% 89% कम
NVMe-oF रीड लेटेंसी (स्टोरेज) 185 μs 12 μs 15 गुना तेज़

परिचालन लाभः टीसीओ और बुनियादी ढांचे की दक्षता

जबकि प्रदर्शन में वृद्धि नाटकीय थी, परिचालन और वित्तीय लाभ समान रूप से उल्लेखनीय थे।MCX623106AN-CDAT ईथरनेट एडाप्टर कार्ड समाधानस्वामित्व की कुल लागत को कम किया, एक अलग InfiniBand कपड़े की आवश्यकता को समाप्त कर दिया, स्विच बुनियादी ढांचे की लागत में $ 500K से अधिक की बचत।एडेप्टर के ऊर्जा कुशल डिजाइन (प्रति कार्ड 20W से कम) ने 128 नोड क्लस्टर में मापने योग्य बिजली बचत में योगदान दिया, जिससे वार्षिक शीतलन व्यय में अनुमानित 18% की कमी आई।

आईटी प्रबंधकों के लिएMCX623106AN-CDAT कीमतवैकल्पिक समाधानों के खिलाफ, डीपकोर के बुनियादी ढांचे के निदेशक ने कहा कि वापसी की अवधि छह महीने से कम थी, मुख्य रूप से कम प्रशिक्षण समय के कारण।जो सीधे अपने उत्पाद विकास पाइपलाइन में तेजी लाई. टीम ने एडाप्टर के भविष्य के सबूत को भी महत्व दिया:बिक्री के लिए MCX623106AN-CDATआज 200GbE का समर्थन करता है लेकिन 100GbE और 50GbE ऑप्टिक्स के साथ भी संगत है, हाइब्रिड-स्पीड वातावरण और क्रमिक उन्नयन के लिए लचीलापन प्रदान करता है।

के अनुसारMCX623106AN-CDAT विनिर्देश, एडेप्टर में इन-बैंड नेटवर्क टेलीमेट्री (आईएनटी) और प्रति-प्रवाह विलंबता ट्रैकिंग सहित व्यापक टेलीमेट्री सुविधाएँ शामिल हैं। डीपकोर ने इन मीट्रिक्स को अपने प्रोमेथियस/ग्राफाना स्टैक में एकीकृत किया है।,प्रशिक्षण प्रदर्शन को प्रभावित करने से पहले सूक्ष्म-जमाव का सक्रिय पता लगाने में सक्षम। टीम ने ईसीएन सीमाओं को गतिशील रूप से समायोजित करने के लिए एडाप्टर के भीड़ नियंत्रण एल्गोरिदम का भी लाभ उठाया,अतिरिक्त नेटवर्क भार उत्पन्न करने वाले चेकपॉइंटिंग संचालन के दौरान भी हानि रहित व्यवहार बनाए रखना.

सारांश और दृष्टिकोणः एआई-स्केल नेटवर्किंग के लिए एक ब्लूप्रिंट

डीपकोर लैब्स की यात्राNVIDIA Mellanox MCX623106AN-CDATसंगठनों के लिए एक स्पष्ट खाका प्रदर्शित करता है जो एआई बुनियादी ढांचे का निर्माण या स्केलिंग करते हैं। दोहरी-पोर्ट 200GbE थ्रूपुट, पीसीआईई 5.0 होस्ट इंटरफ़ेस और GPUDirect-सक्षम आरडीएमए को जोड़कर,MCX623106AN-CDAT ईथरनेट एडाप्टर कार्डस्केलिंग की बाधा से नेटवर्क को एक प्रदर्शन गुणक में बदल देता है। परिणाम ∙ 8.4 गुना तेज़, 94% GPU उपयोग,और 55% तेज़ प्रशिक्षण चक्र सबसे अधिक मांग वाले कंप्यूटिंग वातावरण में मूर्त व्यावसायिक परिणाम देने के लिए एडेप्टर की क्षमता के बारे में बात करते हैं.

आगे देखते हुए, जैसा कि मॉडल आकार हर कुछ महीनों में दोगुना होता रहता है और वितरित प्रशिक्षण क्लस्टर हजारों जीपीयू तक विस्तारित होते हैं,MCX623106AN-CDAT कनेक्टएक्स एडाप्टर PCIe नेटवर्क कार्डनुकसान रहित, अति कम विलंबता वाले कपड़े के लिए एक ठोस आधार प्रदान करता है। वास्तुकारों और आईटी नेताओं के लिए जो अपने अगले एआई बुनियादी ढांचे के निवेश की योजना बना रहे हैं, यह एडेप्टर केवल एक घटक का प्रतिनिधित्व नहीं करता है,लेकिन प्रतिस्पर्धी भेदभाव के लिए एक रणनीतिक सक्षमविस्तृत ट्यूनिंग पैरामीटर, तैनाती स्क्रिप्ट और प्रदर्शन बेंचमार्क रिपोर्ट आधिकारिक वेबसाइट पर उपलब्ध हैं।MCX623106AN-CDAT डेटाशीटयह किसी भी बड़े पैमाने पर एआई की तैनाती के लिए एक आवश्यक संदर्भ है।