실전: NVIDIA Mellanox 920-9B210-00FN-0D0을 이용한 초매개변수 AI 클러스터용 NDR 저지연 패브릭 구축

August 26, 2026

에 대한 최신 회사 뉴스 실전: NVIDIA Mellanox 920-9B210-00FN-0D0을 이용한 초매개변수 AI 클러스터용 NDR 저지연 패브릭 구축

실제 적용 사례: NVIDIA Mellanox 920-9B210-00FN-0D0를 이용한 테라파라미터 AI 클러스터용 NDR 저지연 패브릭 구축

배경 및 과제: HDR과 테라파라미터 모델의 만남

한 선도적인 AI 연구 기관은 최근 대규모 언어 모델 학습 클러스터를 NVIDIA H100 GPU 1,024개에서 4,096개로 확장하여, 1.8조 파라미터 희소 MoE(Mixture of Experts) 모델의 학습 시간을 수개월에서 2주 미만으로 단축하는 것을 목표로 했습니다. 그러나 초기 검증 과정에서 팀은 기존 200Gb/s HDR 패브릭에서 발생하는 심각한 올투올(all-to-all) 통신 병목 현상을 관찰했으며, 이로 인해 GPU 활용률이 예상치 85%에서 52%로 급감하여 야심찬 학습 마감일을 맞추는 데 필요한 임계값보다 훨씬 낮은 수준을 기록했습니다.

네트워크 분석 결과, MoE 아키텍처에 내재된 올투올 집계 연산이 HDR 링크를 포화시키고 지연 시간을 더욱 증폭시키는 혼잡 제어 메커니즘을 트리거하는 것으로 나타났습니다. 이 기관은 수천 개의 엔드포인트에 걸쳐 결정론적인 마이크로초 미만의 지연 시간을 제공하면서 성능 저하 없이 트래픽 버스트를 흡수할 수 있는 대역폭 여유를 제공하는 패브릭이 필요했습니다. 이것이 바로 NVIDIA Mellanox 920-9B210-00FN-0D0가 해결하도록 설계된 과제입니다.

솔루션 및 배포: 엑사스케일 AI를 위한 400Gb/s NDR 패브릭

이 기관은 새로운 2계층 리프-스파인 패브릭의 기반으로 920-9B210-00FN-0D0 InfiniBand 스위치 OPN(주문 부품 번호)을 배포했습니다. 리프 계층에서는 각 랙에 두 개의 920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR 스위치가 설치되어 OSFP-to-OSFP 액티브 광 케이블을 통해 랙당 64개의 듀얼 포트 H100 서버에 400Gb/s 연결을 128개 포트 제공했습니다. 스파인 계층에서는 추가로 16개의 920-9B210-00FN-0D0 스위치가 모든 리프 스위치를 상호 연결하여, 스파인 계층당 51.2Tb/s의 전체 이분산 대역폭을 갖는 비차단 팻트리(fat-tree)를 구성했습니다.

이 솔루션을 특히 매력적으로 만든 것은 스위치의 통합 SHARPv3(Scalable Hierarchical Aggregation and Reduction Protocol) 기술이었습니다. MoE 워크로드의 경우, 올투올 통신은 스위치 패브릭으로 직접 오프로드되었으며, 스위치는 인네트워크 데이터 축소 및 재분배를 수행했습니다. 이를 통해 여러 번의 호스트 측 패스를 거칠 필요가 없어 이전 HDR 배포에서 문제가 되었던 통신 오버헤드가 크게 줄었습니다.

920-9B210-00FN-0D0 데이터시트에 따르면, 이 스위치는 100ns 미만의 컷스루 지연 시간을 제공하며, 이는 개념 증명 단계에서 검증되었습니다. 엔지니어링 팀은 또한 920-9B210-00FN-0D0 호환 에코시스템에 이미 검증된 모든 OSFP 광 모듈 및 케이블이 포함되어 있어 조달 지연이 없음을 확인했습니다. 920-9B210-00FN-0D0 사양에는 듀얼 이중화 전원 공급 장치와 핫스왑 팬이 포함되어 있어, 프로덕션 클러스터의 99.999% 가용성 목표 달성에 대한 팀의 확신을 높였습니다.

결과 및 측정 가능한 이점: 병목 현상에서 가능성으로

전체 NDR 패브릭이 배포되고 MoE 학습 작업이 재시작된 후, 이 기관은 여러 차원에서 혁신적인 개선을 측정했습니다:

  • GPU 활용률 회복: 네트워크로 인한 지연 시간 감소로 인해 평균 GPU 활용률이 52%에서 89%로 급증했으며, 컴퓨팅 집약적인 단계에서는 최대 94%까지 도달했습니다.
  • 올투올 지연 시간 감소: 4,096개 GPU에 걸친 전체 올투올 교환에 필요한 시간이 180ms에서 45ms 미만으로 감소하여 75% 개선되었으며, 이는 학습 반복 속도 향상으로 직접 이어졌습니다.
  • 작업 완료 시간: 1.8T MoE 모델의 예상 학습 시간이 14일에서 9일로 단축되어 36% 가속화되었으며, 이는 시장 출시 시간과 클라우드 컴퓨팅 비용을 크게 절감했습니다.
  • 운영 효율성: 스위치당 64개의 포트를 사용하여 40포트 HDR 설계에 비해 스파인 스위치 수가 37% 감소하여 케이블링이 단순화되고 랙당 전력 소비가 28% 감소했습니다.

총 소유 비용 관점에서 볼 때, 이 기관의 재무팀은 920-9B210-00FN-0D0 가격이 HDR 대안보다 높았지만, 더 높은 라딕스와 감소된 스위치 계층 수로 인해 GPU당 네트워킹 비용이 실제로 감소했다고 언급했습니다. 이러한 경제적 이점과 극적인 성능 향상이 결합되어 NDR 업그레이드는 명확한 비즈니스 승리가 되었습니다. 920-9B210-00FN-0D0 InfiniBand 스위치 OPN 솔루션은 또한 기존 NVIDIA UFM 배포와 원활하게 통합되어 중앙 집중식 가시성과 자동화된 경고를 제공하여 운영 오버헤드를 40% 줄였습니다.

요약 및 전망: 차세대 AI를 위한 NDR 기반

NVIDIA Mellanox 920-9B210-00FN-0D0은 이 AI 연구 기관이 4,096개 GPU H100 클러스터의 잠재력을 최대한 발휘하는 데 필요한 혁신적인 솔루션임이 입증되었습니다. 400Gb/s NDR 대역폭, 64포트 밀도 및 SHARPv3 인네트워크 컴퓨팅을 제공함으로써, 이 스위치는 이전 HDR 인프라로는 불가능했을 성능 또는 관리 가능성을 저해하지 않고 1,024개에서 4,096개 GPU로 확장할 수 있도록 했습니다.

앞으로 이 기관은 향후 18개월 내에 8,192개의 GPU로 확장할 계획이며, NVIDIA 채널 파트너를 통해 920-9B210-00FN-0D0 판매를 활용하여 더 큰 3계층 폴디드 클로스(folded-Clos) 패브릭을 구축할 것입니다. 차세대 AI 및 HPC 네트워킹 투자를 평가하는 기관의 경우, 920-9B210-00FN-0D0은 엑사스케일에서 저지연 RDMA 상호 연결 최적화의 약속을 이행하는 입증된 프로덕션 준비 솔루션을 제공합니다.