NVIDIA Mellanox MCX653105A-HDAT 실제 적용: RDMA/RoCE 저지연 전송 및 서버 처리량 최적화

July 29, 2026

에 대한 최신 회사 뉴스 NVIDIA Mellanox MCX653105A-HDAT 실제 적용: RDMA/RoCE 저지연 전송 및 서버 처리량 최적화

NVIDIA Mellanox MCX653105A-HDAT: RDMA/RoCE 낮은 지연 전송 및 서버 처리량 최적화

배경과 도전: 인공지능/HPC 클러스터의 네트워크 병목

한 대기업은 최근 128 노드 GPU 가속 클러스터를 대규모 언어 모델 (LLM) 교육을 위해 배포했습니다.각 노드는 8개의 NVIDIA H100 GPU와 고성능 NVMe 스토리지를 갖추고 있습니다.하지만 32개의 노드 이상으로 확장되면 클러스터의 성능이 급격히 저하되었습니다.TCP/IP 네트워크 스택은 노드당 CPU 자원의 45% 이상을 소비하는 동안여러 25GbE 링크에 기반을 둔 네트워크는 주요 병목이 되었고 GPU 활용을 심각하게 제한하고 수용 가능한 시간표를 훨씬 뛰어넘는 훈련 주기를 연장했습니다.팀은 급히 매우 낮은 지연시간과 대용량 대역폭을 동시에 제공 할 수 있는 솔루션을 필요로 했습니다..

솔루션 및 배포: MCX653105A-HDAT로 직물을 변형

철저한 기술 평가를 거쳐 팀은NVIDIA 멜라녹스 MCX653105A-HDAT각 GPU 노드에는MCX653105A-HDAT ConnectX 어댑터 PCIe 네트워크 카드, 서버당 200Gb/s의 총 대역폭을 제공하기 위해 듀얼 포트 100GbE 연결을 구성합니다.

이 투입은 네 단계로 이루어졌습니다.

  • 1단계 하드웨어 설치 (128개의 노드):각 서버는MCX653105A-HDAT 이더넷 어댑터 카드, 두 QSFP28 포트가 이중 불필요한 NVIDIA 스펙트럼-4 잎 스위치에 연결되어 있습니다. 어댑터는 최신 펌웨어와 NVIDIA OFED 드라이버 스택으로 설치되었습니다.
  • 2단계 RoCEv2 구성:연구팀은 RoCEv2를 전체 조직에서 활성화하고, 손실 없는 이더넷 환경을 구축하기 위해 우선순위 흐름 제어 (PFC) 및 명시적 혼잡 알림 (ECN) 매개 변수를 신중하게 조정했습니다.고급 혼잡 관리 기능은MCX653105A-HDAT 데이터 시트최적의 버퍼 할당을 달성하는 데 중요한 역할을 했습니다.
  • 단계 3 NCCL 최적화:NVIDIA 집단 통신 라이브러리 (NCCL) 는 어댑터의 RDMA 기능을 활용하기 위해 재구성되었습니다.맞춤형 트래픽 스티어링 규칙으로 어댑터의 임베디드 처리 엔진에 프로그래밍되어 LLM 작업 부하의 특정 모든 감소 및 모든 수집 패턴에 최적화됩니다..
  • 4단계: 검증 및 정밀 조정:텔리메트리 데이터를 사용하여MCX653105A-HDAT 사양, 연구팀은 구성을 검증하고, 인터럽트 모더레이션 설정을 정렬하고, 지속적인 모니터링을 위한 기본 성능 메트릭을 설정했습니다.

특히, 어댑터는MCX653105A-HDAT 호환성기존 케이블 인프라와 함께 QSFP28 포트가 100GbE와 25GbE 광학을 모두 지원하여 방해가 되는 케이블 교체없이 우아한 마이그레이션을 가능하게합니다.연구팀은 또한 같은 물리적 포트에서 컴퓨팅과 저장 기능을 지원하기 위해 어댑터의 멀티 호스트 기능을 활용했습니다..

결과와 이점: 훈련 성능의 측정 가능한 이득

그 결과 성능 향상은NVIDIA 멜라녹스 MCX653105A-HDAT모든 초기 예측을 초과했습니다. 업그레이드 이전과 후의 주요 성능 메트릭은 아래와 같이 요약됩니다.

메트릭 사전 업그레이드 (25GbE TCP/IP) 갱신 후 (MCX653105A-HDAT RoCE) 개선
모든 감소 지연 (128 노드) 9.2ms 0.28ms 32.8× 감소
네트워크 CPU 사용량 (노드당) 47% 6% 41 pp 재구성
GPU 사용 (훈련 단계) 58% 94% +36% 증가
클러스터 훈련 생산량 1.9x 기본값 5.7x 기준값 3배 증가

이러한 수치적 성과 외에도, 팀은 상당한 운영 이점을 관찰했습니다. 이전에는 12일 정도 걸렸던 훈련 경로가 단지 4일 만에 완료되었습니다.모델 반복 주기를 극적으로 가속화합니다.어댑터의 프로그래밍 가능한 데이터 경로는 우선 순위 흐름에 대한 사용자 정의 트래픽 모양을 가능하게하여 중요한 집단 통신 트래픽이 결코 분쟁을 겪지 않도록했습니다.투자 수익률을 평가하는 조직의 경우,MCX653105A-HDAT 가격3 × 처리량 증가와 추가 GPU 서버 인수를 최소 12 개월 연기 할 수있는 능력으로 완전히 정당화되었습니다.MCX653105A-HDAT 판매NVIDIA 스펙트럼-4 스위치를 탑재한 팩은 전체 클러스터 배포에 가장 유리한 경제성을 제공했습니다.

요약 & 전망: 차세대 인공지능 인프라를 위한 기초

이 생산 규모의 배포는NVIDIA 멜라녹스 MCX653105A-HDAT현대 인공지능과 HPC 클러스터를 위한 변형적인 요소입니다. 200 Gb/s의 총 대역폭, 0.3 밀리 초의 집단 통신 지연의 조합,그리고 포괄적인 하드웨어 오프로드는 조직이 GPU 가속 작업 부하에 대해 거의 선형적인 확장성을 달성 할 수 있습니다.끝에서 끝으로MCX653105A-HDAT 이더넷 어댑터 카드 솔루션, 그것은 역사적으로 분산 교육의 효율성을 제한 한 네트워크 병목을 제거합니다.

앞으로는 엔터프라이즈가 NVIDIA DOCA와의 통합을 탐구하여 작업량 특정 최적화를 위해 추가 데이터 경로 프로그래밍을 구현합니다.그들은 또한 어댑터의 고급 텔레메트리를 활용하고 있습니다.MCX653105A-HDAT 데이터 시트- 예측 성능 모델과 자동화 된 혼잡 완화 전략을 구축합니다.NVIDIA 멜라녹스 MCX653105A-HDAT인공지능 인프라 로드맵의 초석이 되었고, 다음 세대의 기반 모델 개발과 배포를 위한 견고하고 확장 가능한 기반을 제공합니다.