NVIDIA Mellanox MQM8790-HS2F 인피니밴드 스위치 작동: RDMA/HPC/AI 클러스터를 위한 저연속 인터커넥트를 최적화

August 21, 2026

에 대한 최신 회사 뉴스 NVIDIA Mellanox MQM8790-HS2F 인피니밴드 스위치 작동: RDMA/HPC/AI 클러스터를 위한 저연속 인터커넥트를 최적화

NVIDIA Mellanox MQM8790-HS2F InfiniBand 스위치 활용: RDMA/HPC/AI 클러스터를 위한 저지연 상호 연결 최적화

대규모 AI 모델 학습 및 고성능 컴퓨팅(HPC) 분야에서 네트워크 지연은 종종 클러스터 확장성 및 효율성을 제한하는 결정적인 병목 현상이 됩니다. 한 국가급 슈퍼컴퓨팅 센터는 최근 100Gb/s EDR InfiniBand 패브릭에서 NVIDIA Mellanox MQM8790-HS2F InfiniBand 스위치를 중심으로 구축된 200Gb/s HDR 솔루션으로 전환하는 대규모 인프라 업그레이드를 완료했습니다. 이 사례 연구는 그들이 직면한 과제, 배포 전략 및 차세대 상호 연결을 통해 달성된 측정 가능한 성능 향상을 살펴봅니다.

배경 및 과제: 지연이 성능 상한선이 될 때

슈퍼컴퓨팅 센터는 날씨 시뮬레이션, 유전체 연구, 대규모 언어 모델 학습을 포함한 다양한 워크로드 혼합을 지원하는 2,000개 이상의 GPU 노드로 구성된 이기종 클러스터를 운영합니다. 이전 100Gb/s EDR 네트워크를 사용하면서 운영팀은 노드 수가 증가함에 따라 all-reduce 및 all-gather와 같은 집계 통신 작업이 전체 작업 실행 시간에서 차지하는 비중이 증가하는 것을 관찰했습니다. 일부 분산 학습 작업에서는 네트워크 관련 오버헤드가 종단 간 실행 시간의 거의 40%를 차지하여 GPU 활용도를 심각하게 제한하고 모델 수렴 주기를 연장했습니다.

추가 과제는 다음과 같습니다.

  • 혼잡 핫스팟: AI 학습의 트래픽 패턴은 종종 버스트성이며 예측 불가능하여 헤드 오브 라인 차단 및 꼬리 지연 스파이크가 발생하여 작업 스케줄링을 방해했습니다.
  • 부족한 네트워크 내 가속: 레거시 패브릭은 고급 집계 오프로드 기능을 지원하지 않아 모든 축소 작업이 호스트 CPU 및 메모리 계층 구조를 통과해야 했습니다.
  • 관리 복잡성: 성능 문제 해결에는 여러 모니터링 도구의 수동 분석이 필요하여 대규모 배포에서 근본 원인을 파악하기 어려웠습니다.

여러 상호 연결 옵션을 평가한 후 센터는 새로운 패브릭의 기반으로 MQM8790-HS2F를 선택했습니다. MQM8790-HS2F 데이터시트에 따르면 이 스위치는 200Gb/s HDR 비차단 처리량 40포트, 130ns 미만의 컷스루 지연, SHARP v3.0 집계 오프로드 지원을 제공하여 핵심적인 문제점을 직접적으로 해결했습니다.

솔루션 및 배포: 저지연 AI/HPC 패브릭 구축

배포는 2계층 팻 트리 토폴로지를 채택했으며, 24개의 MQM8790-HS2F 200Gb/s HDR 40포트 QSFP56 스위치가 리프 노드로 배포되고 8개의 유닛이 스파인 스위치로 사용되었습니다. 이 구성은 전체 클러스터에 걸쳐 2:1의 과잉 구독을 제공하여 현재 워크로드에 충분하며 향후 확장을 위한 여유 공간을 제공했습니다.

배포 계층 스위치 수 사용된 포트 연결
리프 (랙당) 24 각 32 포트 ToR 서버 + 스파인 업링크
스파인 8 각 36 포트 모든 리프 스위치에 대한 전체 메시

각 리프 스위치는 NVIDIA ConnectX-6 HDR 호스트 채널 어댑터를 통해 컴퓨팅 노드에 연결됩니다. MQM8790-HS2F 호환 광학 및 케이블 에코시스템을 통해 팀은 기존 QSFP56 케이블을 재사용하여 배포를 가속화하고 조달 비용을 절감할 수 있었습니다. 전체 물리적 설치는 2주 이내에 완료되었으며, 제어 평면은 NVIDIA의 Unified Fabric Manager(UFM)를 활용하여 자동화된 토폴로지 검색 및 프로비저닝을 수행했습니다.

스위치의 적응형 라우팅 및 혼잡 제어 지원은 AI 워크로드의 특징인 버스트 트래픽을 처리하는 데 중요했습니다. 사용 가능한 경로에 걸쳐 흐름을 동적으로 재분배함으로써 MQM8790-HS2F InfiniBand 스위치는 핫스팟 형성을 최소화하고 피크 작업 스케줄링 기간 동안에도 일관된 성능을 유지했습니다.

결과 및 이점: 작업 처리량 및 GPU 활용도에 대한 측정 가능한 개선

3개월간의 운영 후 슈퍼컴퓨터 센터는 여러 차원에서 상당한 성능 향상을 보고했습니다:

  • 지연 감소: 평균 MPI 핑퐁 지연은 이전 EDR 패브릭의 680ns에서 NVIDIA Mellanox MQM8790-HS2F를 사용했을 때 130ns 미만으로 감소하여 메시지 교환 효율성이 5배 향상되었습니다.
  • 집계 작업 속도 향상: SHARP v3.0 오프로드가 스위치 패브릭 내에서 직접 축소 작업을 수행하여 1024 노드 작업의 all-reduce 지연이 62% 감소했습니다.
  • GPU 활용도: 낮은 지연 시간과 높은 대역폭의 결합 효과로 평균 GPU 활용도가 72%에서 91%로 증가하여 대규모 언어 모델 학습 실행의 시간 대비 솔루션이 26% 감소했습니다.
  • 작업 스케줄링 효율성: 꼬리 지연 편차 감소로 SLURM 스케줄러가 성능 간섭 없이 동일한 노드 세트에 더 많은 작업을 배치할 수 있게 되어 전체 클러스터 처리량이 약 18% 증가했습니다.

나중에 팀이 MQM8790-HS2F 가격을 다른 공급업체의 대체 스위치와 비교했을 때, Gb/s당 총 비용은 매우 경쟁력이 있었으며, 특히 관리 오버헤드 감소와 스위치가 HDR 및 HDR100 링크 속도를 모두 지원하여 혼합 속도 환경에 대한 투자를 보호하는 능력을 고려했을 때 더욱 그랬습니다.

운영 관점에서 통합 UFM 플랫폼은 패브릭 상태, 트래픽 패턴 및 링크 수준 오류를 모니터링하기 위한 단일 창을 제공했습니다. 이 가시성을 통해 팀은 성능이 저하되는 케이블을 사전에 식별하고 예정된 유지 보수 중에 교체하여 계획되지 않은 다운타임을 방지할 수 있었습니다.

요약 및 전망: 차세대 저지연 패브릭을 위한 청사진

이 사례 연구는 MQM8790-HS2F InfiniBand 스위치 솔루션이 단순한 속도 업그레이드 이상이며 AI 및 HPC 인프라의 전체 성능 잠재력을 발휘하려는 조직에게 혁신적인 구성 요소임을 보여줍니다. 높은 포트 밀도, 초저 지연, 네트워크 내 컴퓨팅 기능을 결합하여 스위치는 역사적으로 클러스터 확장성을 제한했던 통신 병목 현상을 직접적으로 해결합니다.

앞으로 슈퍼컴퓨터 센터는 다음 회계 연도에 추가 스파인 스위치를 사용하여 동일한 MQM8790-HS2F 아키텍처를 활용하여 패브릭을 2,400 노드로 확장할 계획입니다. 팀은 또한 스위치의 SHARP v3.0 향상된 축소 알고리즘 지원을 탐색하고 있으며, 이는 그래프 신경망 및 강화 학습과 같은 새로운 워크로드를 더욱 가속화할 것으로 기대됩니다.

자신의 클러스터 구축을 위한 상호 연결 옵션을 평가하는 IT 관리자, 네트워크 설계자 및 엔지니어에게 NVIDIA Mellanox MQM8790-HS2F는 마이크로초 미만의 지연 시간, 최대 GPU 활용도 및 단순화된 패브릭 관리를 달성하기 위한 검증되고 현장에서 검증된 경로를 제공합니다. 자세한 MQM8790-HS2F 사양 및 참조 설계는 NVIDIA의 기술 문서 포털에서 확인할 수 있으며, 스위치는 현재 널리 사용 가능합니다. 지역 파트너를 찾으려면 MQM8790-HS2F 판매를 검색하십시오.