NVIDIA Mellanox MCX623106AN-CDAT 서버 어댑터 실제 적용 | RDMA/RoCE 저지연 전송 및 서버 처리량 향상

July 22, 2026

에 대한 최신 회사 뉴스 NVIDIA Mellanox MCX623106AN-CDAT 서버 어댑터 실제 적용 | RDMA/RoCE 저지연 전송 및 서버 처리량 향상

NVIDIA Mellanox MCX623106AN-CDAT 서버 어댑터 활용 | RDMA/RoCE 저지연 전송 및 서버 처리량 향상

배경 및 과제: 200GbE가 AI 확장 벽에 부딪힐 때

빠르게 성장하는 AI 연구 기관(가칭 "DeepCore Labs")은 심각한 확장 병목 현상에 직면해 있었습니다. 128개의 노드에 분산된 512개의 NVIDIA H100 GPU로 구성된 주력 대규모 언어 모델 학습 클러스터는 64개 노드를 초과하여 확장하면서 심각한 성능 저하를 겪고 있었습니다. 문제는 컴퓨팅이나 메모리가 아니라 네트워크 패브릭이었습니다. All-reduce 동기화 기울기는 반복당 15초 이상 소요되었고, 네트워크 지연으로 인해 GPU 활용률은 62%로 떨어졌습니다. 소프트웨어 기반 TCP/IP에 의존하는 기존 100GbE 인프라는 분산 학습의 버스트성, 지연 시간에 민감한 통신 패턴을 처리할 수 없었습니다. 팀은 마이크로초 수준의 결정론적 지연 시간으로 라인 속도 200GbE 처리량을 제공할 수 있는 솔루션이 필요했습니다.

그들의 평가는 NVIDIA Mellanox MCX623106AN-CDAT으로 이어졌습니다. 이는 가장 까다로운 AI 및 HPC 워크로드를 위해 설계된 200GbE 서버 어댑터입니다. 연구팀은 MCX623106AN-CDAT ConnectX 어댑터 PCIe 네트워크 카드가 네트워크 병목 현상을 제거하고 GPU 활용률을 극대화하는 데 필요한 고급 오프로드 및 GPUDirect 기능을 제공한다는 것을 인식했습니다.

솔루션: MCX623106AN-CDAT 이더넷 어댑터 카드 배포

DeepCore Labs는 128개의 모든 학습 노드에 MCX623106AN-CDAT 이더넷 어댑터 카드를 배포했으며, 각 서버에는 NVIDIA Spectrum-4 스위치를 기반으로 구축된 리프-스파인 패브릭에 연결된 듀얼 포트 QSFP112 어댑터가 장착되었습니다. 이 배포는 어댑터의 네이티브 RoCE v2 지원을 활용하여 별도의 InfiniBand 패브릭의 필요성을 제거하고 무손실 이더넷 전송을 가능하게 했습니다. 솔루션의 핵심은 어댑터의 GPUDirect RDMA 기능으로, CPU 개입 없이 네트워크를 통해 GPU 간에 직접 데이터를 이동할 수 있도록 하여 동기화 오버헤드를 줄이는 데 중요한 기능이었습니다.

팀은 스위치 수준에서 PFC(Priority Flow Control) 및 ECN(Explicit Congestion Notification)을 구성하여 집계 통신 트래픽에 우선 순위 3을, 스토리지 I/O에 우선 순위 4를 할당했습니다. 또한 NVIDIA의 적응형 라우팅 기술을 구현하여 여러 경로에 걸쳐 트래픽을 동적으로 분산시켜 핫스팟을 최소화했습니다. 4주 이내에 전체 학습 패브릭이 RDMA로 실행되었으며, 512개의 GPU 모두 RoCE를 통해 원활하게 통신했습니다. MCX623106AN-CDAT 호환 생태계는 강력한 것으로 입증되었습니다. 카드는 H100 기반 서버 및 NVIDIA의 NCCL(NVIDIA Collective Communications Library)과 수정 없이 완벽하게 통합되었습니다.

팀은 MCX623106AN-CDAT 데이터시트를 참조하여 버퍼 할당 및 혼잡 제어 매개변수를 미세 조정하여 동기 학습(all-reduce 중심) 및 비동기 체크포인팅을 포함한 혼합 워크로드 환경에 대한 최적의 성능을 달성했습니다.

측정 가능한 결과: 확장 효율성, 처리량 및 GPU 활용률

성능 향상은 혁신적이었습니다. NVIDIA Mellanox MCX623106AN-CDAT를 통해 활성화된 RoCE를 통한 RDMA를 사용하면 all-reduce 동기화 지연 시간이 평균 15.2초에서 반복당 1.8초로 감소했습니다. 이는 8.4배 향상된 수치입니다. 이는 모델 수렴 속도를 직접적으로 향상시켰습니다. 70B 매개변수 모델의 총 학습 시간은 42일에서 19일로 단축되어 연구 주기를 50% 이상 가속화했습니다.

네트워크 지연으로 인해 62%에 머물렀던 GPU 활용률은 업그레이드 후 94%로 급증하여 유효 컴퓨팅 용량이 52% 향상되었습니다. 어댑터의 고급 순서 외 데이터 배치 및 패킷 페이싱은 테일 지연 시간 스파이크를 유발했던 마이크로 버스트를 제거하여 모든 노드에서 일관된 성능을 보장했습니다.

학습 성능을 넘어 서버 처리량 향상도 마찬가지로 인상적이었습니다. 하드웨어 오프로드 엔진(체크섬 오프로드, LSO/LRO, RoCE 가속 포함)은 모든 노드에서 네트워크 처리를 위한 CPU 활용률을 38%에서 4% 미만으로 줄였습니다. 이를 통해 이전에 제한되었던 데이터 전처리, 체크포인트 압축 및 기타 보조 작업을 위한 상당한 CPU 용량을 확보했습니다.

지표 이전 (레거시 100GbE NIC) 이후 (MCX623106AN-CDAT) 개선
All-Reduce 지연 시간 (반복당) 15.2초 1.8초 8.4배 빠름
GPU 활용률 62% 94% 52% 높음
모델 학습 시간 (70B 매개변수) 42일 19일 55% 빠름
CPU 네트워크 오버헤드 38% 4% 미만 89% 낮음
NVMe-oF 읽기 지연 시간 (스토리지) 185μs 12μs 15배 빠름

운영 이점: TCO 및 인프라 효율성

성능 향상은 극적이었지만 운영 및 재정적 이점도 마찬가지로 주목할 만했습니다. MCX623106AN-CDAT 이더넷 어댑터 카드 솔루션은 별도의 InfiniBand 패브릭의 필요성을 제거하여 총 소유 비용을 절감했습니다. 스위치 인프라 비용으로 50만 달러 이상 절감되었습니다. 어댑터의 에너지 효율적인 설계(카드당 20W 미만)는 128개 노드 클러스터 전체에서 측정 가능한 전력 절감에 기여하여 연간 냉각 비용을 약 18% 절감했습니다.

MCX623106AN-CDAT 가격을 다른 솔루션과 비교 평가하는 IT 관리자의 경우 DeepCore의 인프라 책임자는 제품 개발 파이프라인을 직접적으로 가속화한 학습 시간 단축으로 인해 투자 회수 기간이 6개월 미만이라고 언급했습니다. 팀은 또한 어댑터의 미래 보장성을 높이 평가했습니다. 오늘날 판매되는 동일한 MCX623106AN-CDAT은 200GbE를 지원하지만 100GbE 및 50GbE 광학 장치와도 호환되어 하이브리드 속도 환경 및 점진적 업그레이드에 유연성을 제공합니다.

MCX623106AN-CDAT 사양에 따르면 어댑터에는 인밴드 네트워크 텔레메트리(INT) 및 플로우별 지연 시간 추적을 포함한 포괄적인 텔레메트리 기능이 포함되어 있습니다. DeepCore는 이러한 메트릭을 Prometheus/Grafana 스택에 통합하여 학습 성능에 영향을 미치기 전에 마이크로 혼잡을 사전에 감지할 수 있었습니다. 팀은 또한 어댑터의 혼잡 제어 알고리즘을 활용하여 ECN 임계값을 동적으로 조정하여 추가 네트워크 부하를 생성하는 체크포인팅 작업 중에도 무손실 동작을 유지했습니다.

요약 및 전망: AI 규모 네트워킹을 위한 청사진

DeepCore Labs의 NVIDIA Mellanox MCX623106AN-CDAT 여정은 AI 인프라를 구축하거나 확장하는 조직을 위한 명확한 청사진을 보여줍니다. 듀얼 포트 200GbE 처리량, PCIe 5.0 호스트 인터페이스 및 GPUDirect 지원 RDMA를 결합한 MCX623106AN-CDAT 이더넷 어댑터 카드는 네트워크를 확장 병목 현상에서 성능 승수로 변환합니다. 8.4배 빠른 all-reduce, 94% GPU 활용률 및 55% 빠른 학습 주기와 같은 결과는 가장 까다로운 컴퓨팅 환경에서 실질적인 비즈니스 성과를 제공하는 어댑터의 능력을 보여줍니다.

앞으로 모델 크기가 몇 달마다 두 배로 늘어나고 분산 학습 클러스터가 수천 개의 GPU로 확장됨에 따라 MCX623106AN-CDAT ConnectX 어댑터 PCIe 네트워크 카드는 무손실, 초저지연 패브릭을 위한 견고한 기반을 제공합니다. 다음 AI 인프라 투자를 계획하는 설계자 및 IT 리더에게 이 어댑터는 단순한 구성 요소가 아니라 경쟁 우위를 위한 전략적 인에이블러입니다. 자세한 튜닝 매개변수, 배포 스크립트 및 성능 벤치마크 보고서는 공식 MCX623106AN-CDAT 데이터시트에서 확인할 수 있습니다. 이는 대규모 AI 배포에 필수적인 참조 자료입니다.