NVIDIA Mellanox MCX653105A-HDAT एक्शन मेंः आरडीएमए/आरओसीई कम विलंबता परिवहन और सर्वर थ्रूपुट अनुकूलन
July 29, 2026
NVIDIA Mellanox MCX653105A-HDAT एक्शन मेंः आरडीएमए/आरओसीई कम विलंबता परिवहन और सर्वर थ्रूपुट अनुकूलन
पृष्ठभूमि और चुनौतियां: एक एआई/एचपीसी क्लस्टर में नेटवर्क की बाधा
एक बड़े प्रौद्योगिकी उद्यम ने हाल ही में बड़े भाषा मॉडल (LLM) प्रशिक्षण के लिए 128 नोड GPU- त्वरित क्लस्टर को तैनात किया है,प्रत्येक नोड के साथ आठ NVIDIA H100 GPUs और उच्च प्रदर्शन NVMe भंडारण से लैसहालांकि, 32 नोड्स से परे स्केलिंग पर, क्लस्टर ने नाटकीय प्रदर्शन गिरावट का अनुभव किया। ऑल-रिड्यूस सामूहिक संचार विलंबता 8-10 मिलीसेकंड तक बढ़ गई,जबकि टीसीपी/आईपी नेटवर्किंग स्टैक ने प्रति नोड सीपीयू संसाधनों का 45% से अधिक उपभोग कियाकई 25GbE लिंक्स पर निर्मित नेटवर्क मुख्य बाधा बन गया था, जिससे GPU के उपयोग को गंभीर रूप से सीमित किया गया था और प्रशिक्षण चक्र को स्वीकार्य समय सीमा से बहुत आगे बढ़ाया गया था।टीम को तत्काल एक समाधान की आवश्यकता थी जो सीपीयू-गहन नेटवर्क प्रसंस्करण को ऑफलोड करते हुए अल्ट्रा-लो लेटेंसी और विशाल बैंडविड्थ दोनों प्रदान करने में सक्षम हो।.
समाधान और तैनातीः MCX653105A-HDAT के साथ कपड़े को बदलना
एक विस्तृत तकनीकी मूल्यांकन के बाद, टीम नेNVIDIA Mellanox MCX653105A-HDATउनके नेटवर्क परिवर्तन के लिए नींव के रूप में. प्रत्येक जीपीयू नोड एक के साथ सुसज्जित थाMCX653105A-HDAT कनेक्टएक्स एडाप्टर PCIe नेटवर्क कार्ड, 200 Gb/s प्रति सर्वर कुल बैंडविड्थ प्रदान करने के लिए दोहरी-पोर्ट 100GbE कनेक्टिविटी के साथ कॉन्फ़िगर किया गया।
यह चार संरचित चरणों में किया गया था:
- चरण 1 हार्डवेयर की स्थापना (128 नोड्स):प्रत्येक सर्वर कोMCX653105A-HDAT ईथरनेट एडाप्टर कार्ड, दोनों क्यूएसएफपी 28 पोर्ट दोहरे रिडंडेंट एनवीआईडीआईए स्पेक्ट्रम -4 लीफ स्विच से जुड़े थे। एडेप्टर नवीनतम फर्मवेयर और एनवीआईडीआईए ओएफईडी ड्राइवर स्टैक के साथ स्थापित किए गए थे।
- चरण 2 ️ RoCEv2 कॉन्फ़िगरेशनःटीम ने पूरे फैब्रिक में RoCEv2 को सक्षम किया, एक हानि रहित ईथरनेट वातावरण स्थापित करने के लिए प्राथमिकता प्रवाह नियंत्रण (पीएफसी) और स्पष्ट भीड़ सूचना (ईसीएन) मापदंडों को सावधानीपूर्वक समायोजित किया।उन्नत भीड़ प्रबंधन सुविधाओं का विवरणMCX653105A-HDAT डेटाशीटइष्टतम बफर आवंटन प्राप्त करने में सहायक थे।
- चरण 3 NCCL अनुकूलनःNVIDIA सामूहिक संचार पुस्तकालय (NCCL) को एडेप्टर की RDMA क्षमताओं का लाभ उठाने के लिए पुनः कॉन्फ़िगर किया गया था,अनुकूलित यातायात स्टीयरिंग नियमों के साथ एलएलएम कार्यभार के विशिष्ट सभी-कम और सभी-एकजुट पैटर्न के लिए अनुकूलित करने के लिए एडेप्टर के एम्बेडेड प्रसंस्करण इंजन में प्रोग्राम किया गया.
- चरण 4 ️ सत्यापन और परिष्कृत समायोजनःटेलीमेट्री डेटा का उपयोग करकेMCX653105A-HDAT विनिर्देश, टीम ने कॉन्फ़िगरेशन को मान्य किया, इंटरप्ट मॉडरेशन सेटिंग्स को ठीक किया, और चल रही निगरानी के लिए आधारभूत प्रदर्शन मीट्रिक स्थापित किए।
विशेष रूप से, एडाप्टर साबित हुआMCX653105A-HDAT संगतमौजूदा केबलिंग बुनियादी ढांचे के साथ, क्यूएसएफपी 28 पोर्ट 100GbE और 25GbE ऑप्टिक्स दोनों का समर्थन करते हैं, जिससे बिना किसी व्यवधान केबल प्रतिस्थापन के एक सुरुचिपूर्ण माइग्रेशन संभव हो जाता है।टीम ने एक ही भौतिक पोर्ट पर कंप्यूटिंग और स्टोरेज दोनों कार्यों का समर्थन करने के लिए एडेप्टर की मल्टी-होस्ट क्षमताओं का भी लाभ उठाया.
परिणाम और लाभः प्रशिक्षण प्रदर्शन में मापने योग्य लाभ
कार्यप्रणाली में सुधारNVIDIA Mellanox MCX653105A-HDATउन्नयन से पहले और बाद में प्रमुख प्रदर्शन मीट्रिक नीचे संक्षेप में दिए गए हैंः
| मीट्रिक | पूर्व उन्नयन (25GbE TCP/IP) | पोस्ट-अपग्रेड (MCX653105A-HDAT RoCE के साथ) | सुधार |
|---|---|---|---|
| ऑल-रिड्यूस लेटेंसी (128 नोड्स) | 9.2 एमएस | 0.28 एमएस | 32.8 गुना कमी |
| नेटवर्क सीपीयू उपयोग (प्रति नोड) | 47% | ६% | 41 पीपी रिकवरी |
| GPU उपयोग (प्रशिक्षण चरण) | 58% | 94% | +36% की वृद्धि |
| क्लस्टर प्रशिक्षण के माध्यम से उत्पादन | 1.9x आधार रेखा | 5.7x आधार रेखा | 3 गुना वृद्धि |
इन मात्रात्मक उपलब्धियों के अलावा, टीम ने महत्वपूर्ण परिचालन लाभ देखे। प्रशिक्षण रन जो पहले 12 दिनों का समय लेते थे, केवल 4 दिनों में पूरे हो गए।मॉडल पुनरावृत्ति चक्रों को नाटकीय रूप से तेज करनाएडाप्टर के प्रोग्राम करने योग्य डेटा-पथ ने प्राथमिकता प्रवाहों के लिए कस्टम ट्रैफ़िक शेपिंग को सक्षम किया, यह सुनिश्चित करते हुए कि महत्वपूर्ण सामूहिक संचार यातायात को कभी भी विवाद का सामना नहीं करना पड़ा।निवेश पर वापसी का आकलन करने वाले संगठनों के लिए,MCX653105A-HDAT कीमत3 गुना थ्रूपुट लाभ और अतिरिक्त जीपीयू सर्वर अधिग्रहण को कम से कम 12 महीने के लिए स्थगित करने की क्षमता से पूरी तरह से उचित साबित हुआ। टीम ने कहा किबिक्री के लिए MCX653105A-HDATएनवीआईडीआईए स्पेक्ट्रम-4 स्विच के साथ बंडलों ने पूर्ण-क्लस्टर तैनाती के लिए सबसे अनुकूल अर्थव्यवस्था प्रदान की।
सारांश और दृष्टिकोणः अगली पीढ़ी के एआई बुनियादी ढांचे के लिए एक नींव
यह उत्पादन-स्तर की तैनाती यह प्रमाणित करती है किNVIDIA Mellanox MCX653105A-HDATआधुनिक एआई और एचपीसी क्लस्टर के लिए एक परिवर्तनकारी घटक है। 200 जीबी/सेकंड की कुल बैंडविड्थ का संयोजन, 0.3 मिलीसेकंड के तहत सामूहिक संचार विलंबता,और व्यापक हार्डवेयर offloads संगठनों जीपीयू-त्वरित कार्यभार के लिए लगभग रैखिक स्केलिंग प्राप्त करने के लिए सक्षम बनाता हैअंत से अंत तकMCX653105A-HDAT ईथरनेट एडाप्टर कार्ड समाधान, यह उस नेटवर्क की बाधा को समाप्त करता है जिसने ऐतिहासिक रूप से वितरित प्रशिक्षण की दक्षता को सीमित किया है।
आगे देखते हुए, उद्यम कार्यभार-विशिष्ट अनुकूलन के लिए अतिरिक्त डेटा-पथ प्रोग्रामेबिलिटी को लागू करने के लिए NVIDIA DOCA के साथ एकीकरण की खोज कर रहा है।वे एडाप्टर की उन्नत टेलीमेट्री का भी लाभ उठा रहे हैं MCX653105A-HDAT डेटाशीट- पूर्वानुमानित प्रदर्शन मॉडल और स्वचालित भीड़भाड़ को कम करने की रणनीतियों का निर्माण करना।NVIDIA Mellanox MCX653105A-HDATयह उनकी एआई बुनियादी ढांचे के रोडमैप का आधार बन गया है, जो अगली पीढ़ी के फाउंडेशन मॉडल विकास और तैनाती के लिए एक मजबूत, स्केलेबल आधार प्रदान करता है।

