NVIDIA Mellanox MCX653106A-HDAT: RDMA/RoCE 낮은 지연 전송 및 서버 처리량 최적화
July 30, 2026
A major hyperscale cloud provider operating a 256-node cluster for distributed AI training and real-time analytics began experiencing severe network performance degradation as their infrastructure scaled기존 25GbE TCP/IP 기반의 조직은 128개의 노드에서 6 밀리초를 초과하는 모든 감소 지연을 보여주었습니다.네트워크 처리용 CPU 사용량은 각 서버의 컴퓨팅 용량의 40% 이상을 소비하는 동안이 병목은 GPU 사용량을 55%로 제한하여 교육 주기를 크게 늘리고 수익 창출 능력을 줄였습니다.연구팀은 마이크로초 규모의 지연시간과 대용량 대역폭을 동시에 제공 할 수 있는 솔루션이 필요했습니다. 작업 부하별 트래픽 최적화에 필요한 프로그래밍 가능성.
광범위한 기술 평가를 거쳐 공급자는NVIDIA 멜라녹스 MCX653106A-HDAT각 서버 노드에는MCX653106A-HDAT ConnectX 어댑터 PCIe 네트워크 카드이중 포트 100GbE 연결으로 구성되어 노드당 200Gb/s의 총 대역폭을 제공합니다.
- 1단계: 파일럿 (8개의 노드):연구팀은MCX653106A-HDAT 이더넷 어댑터 카드GPU 서버의 하위 집합에서 RoCEv2를 PFC와 ECN로 구성하여 손실 없는 이더넷 조직을 구축했습니다. 어댑터는 끝에서 끝까지 혼잡 관리를 위해 NVIDIA 스펙트럼-4 스위치와 결합되었습니다.
- 2단계 확인 및 조정:이 자료에서 기록된 텔레미터 데이터를 사용하여MCX653106A-HDAT 데이터 시트, 팀은 구성을 검증하고 DCB 매개 변수를 세밀하게 조정하고 NCCL 집단 통신 설정을 최적화했습니다.어댑터의 고급 프로그래밍 기능은 작업량의 특정 모든 감소 패턴에 맞춘 트래픽 스티어링을 가능하게했습니다..
- 3단계: 완전 생산 출동 (256개의 노드):성공적 인 검증 후 전체 클러스터가 새로운 어댑터로 마이그레이션되었습니다.MCX653106A-HDAT 호환성솔루션의 특성으로 인해 기존 서버와 리눅스 배포판과 원활한 통합이 가능했습니다.
- 4단계: 지속적인 최적화연구팀은 어댑터의 인라인 텔레메트리와 프로그래밍 가능한 데이터 경로를 활용하여 작업량 인식 라우팅 정책을 구현하여 AI 훈련 작업의 성능을 더욱 최적화했습니다.
연구팀은MCX653106A-HDAT 이더넷 어댑터 카드 솔루션QSFP56 포트가 100GbE와 25GbE 광학 모두를 지원하여 기존 연결을 방해하지 않고 우아한 전환을 가능하게 하기 때문에 직선적 인 마이그레이션 경로를 제공했습니다.
| 메트릭 | 사전 업그레이드 (25GbE TCP/IP) | 갱신 후 (MCX653106A-HDAT RoCE) | 개선 |
|---|---|---|---|
| 모든 감소 지연 (256 노드) | 6.8ms | 0.22ms | 30.9* 감소 |
| 네트워크 CPU 사용량 (노드당) | 43% | 5% | 38 pp 재구성 |
| GPU 사용 (훈련 단계) | 55% | 93% | +38% 증가 |
| 클러스터 훈련 생산량 | 2.1x 기준값 | 6.4x 기본값 | 3.0* 증가 |
이 양적 이득 외에도 제공자는 상당한 운영 이점을 관찰했습니다. 이전에는 14일 동안 필요한 교육 경기가 단지 4.5일 만에 완료되었습니다.새로운 인공지능 서비스의 시장 진출 시간을 극적으로 가속화합니다.어댑터의 프로그래밍 가능한 데이터 경로는 우선 순위 흐름에 대한 사용자 정의 트래픽 모양을 가능하게하여 중요한 집단 통신 트래픽이 결코 분쟁을 겪지 않도록했습니다.투자 수익을 평가하는 조직에 대해,MCX653106A-HDAT 가격3*의 처리량 증가와 추가 서버 인수를 18개월 이상 연기 할 수있는 능력으로 완전히 정당화되었습니다.MCX653106A-HDAT 판매NVIDIA 스펙트럼-4 스위치를 탑재한 패키지는 대규모 배포에 가장 유리한 경제성을 제공했습니다.
제공자는 또한 전체 텔레메트리 기능을 활용했습니다MCX653106A-HDAT 사양예측 성능 모델과 자동화된 혼잡 완화 전략을 구축하여 운영 효율성을 더욱 향상시킵니다.
이 생산 규모의 배포는NVIDIA 멜라녹스 MCX653106A-HDAT현대 인공지능과 클라우드 인프라를 위한 전환적인 요소입니다.그리고 포괄적인 하드웨어 오프로드는 GPU 가속 작업 부하에 대한 거의 선형적인 확장 기능을 제공합니다.끝에서 끝으로MCX653106A-HDAT 이더넷 어댑터 카드 솔루션, 그것은 역사적으로 분산 교육 효율과 클라우드 서비스 제공을 제한 한 네트워크 병목을 제거합니다.
앞으로는클라우드 공급자는 여러 임대 환경에서 작업량 특정 최적화를 위해 추가 데이터 경로 프로그래밍을 구현하기 위해 NVIDIA DOCA와 확장 된 통합을 탐구하고 있습니다.그들은 또한 어댑터의 인라인 텔레메트리를 활용하고 있습니다.MCX653106A-HDAT 데이터 시트- 다음 세대의 자동화된 성능 관리 시스템을 개발하기 위해NVIDIA 멜라녹스 MCX653106A-HDAT인공지능 인프라 로드맵의 기초가 되었으며, 다음 세대의 기초 모델 교육과 실시간 분석 서비스를 위한 견고하고 확장 가능한 플랫폼을 제공합니다.

