NVIDIA Mellanox 920-9B210-00FN-0D0 기술 참조: 400Gb/s NDR 저지연 상호 연결 최적화
August 26, 2026
NVIDIA Mellanox 920-9B210-00FN-0D0 기술 참조: RDMA/HPC/AI 클러스터를 위한 400Gb/s NDR 저지연 상호 연결 최적화
1. 프로젝트 배경 및 요구사항 분석
AI 학습 클러스터가 4,000개 이상의 GPU로 확장되고 HPC 시뮬레이션이 엑사스케일 성능에 근접함에 따라 네트워크 패브릭은 대역폭, 지연 시간 및 결정성에 대한 전례 없는 요구에 직면하고 있습니다. 200Gb/s HDR에서 400Gb/s NDR로의 전환은 조 단위 매개변수 모델 또는 킬로미터 규모의 날씨 시뮬레이션을 목표로 하는 조직에게 더 이상 선택 사항이 아니라 전략적 필수 사항입니다. 주요 연구 및 엔터프라이즈 배포 전반에 걸쳐 식별된 주요 요구 사항은 다음과 같습니다.
- 초저 결정론적 지연 시간: MPI 및 올투올 통신 오버헤드를 최소화하기 위한 100ns 미만의 포트 간 지연 시간.
- 대규모 무손실 패브릭: 수천 개의 엔드포인트에 걸쳐 혼잡 시 패킷 손실 제로, RDMA 성능이 예측 가능하게 유지되도록 보장.
- 네트워크 내 컴퓨팅 오프로드: GPU 활용도를 극대화하기 위해 네트워크 패브릭으로 집계 연산(all-reduce, all-to-all, broadcast)을 오프로드.
- 고차수 확장성: 최대 8,000개 이상의 노드까지 전체 이분 대역폭을 갖춘 대규모 fat-tree 및 dragonfly+ 토폴로지에 대한 지원.
- 투자 보호: 기존 HDR 케이블, 광학 장치 및 관리 도구와의 원활한 호환성을 통해 단계적 업그레이드 가능.
이러한 요구 사항을 해결하기 위해 이 솔루션은 엑사스케일급 배포에 필요한 밀도, 성능 및 지능을 제공하는 400Gb/s NDR InfiniBand 스위치인 NVIDIA Mellanox 920-9B210-00FN-0D0를 핵심 빌딩 블록으로 채택합니다.
2. 전체 네트워크 아키텍처 설계
제안된 솔루션은 확장 가능하고 비차단 패브릭을 제공하며 결정론적 지연 시간과 단순화된 케이블링을 제공하는 2계층 리프-스파인 토폴로지를 사용합니다. 리프 계층에서는 각 컴퓨팅 랙에 하나 또는 두 개의 920-9B210-00FN-0D0 InfiniBand 스위치 OPN 장치가 장착되어 OSFP-to-OSFP 직접 연결 구리(DAC) 또는 능동 광 케이블(AOC)을 통해 GPU 서버에 64개의 400Gb/s NDR 연결 포트를 제공합니다. 스파인 계층에서는 920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR 스위치의 두 번째 계층이 모든 리프 스위치를 상호 연결하여 전체 이분 대역폭 fat-tree 패브릭을 생성합니다.
5,000개 이상의 노드를 초과하는 클러스터의 경우 3계층 폴디드 클로스 아키텍처를 구현할 수 있으며, 920-9B210-00FN-0D0는 리프와 스파인 역할을 모두 수행하여 모든 레벨에서 일관된 성능을 유지합니다. 이 스위치는 단일 서브넷 관리자에서 단일 패브릭에 최대 64개의 스위치를 지원하여 대규모 토폴로지의 통합 제어를 가능하게 합니다.
다음 표는 920-9B210-00FN-0D0를 중심으로 구축된 2계층 NDR 패브릭의 주요 확장 매개변수를 요약합니다.
| 구성 요소 | 사양 | 값 |
|---|---|---|
| 리프 스위치 | 920-9B210-00FN-0D0 | 랙당 1-2개 |
| 스파인 스위치 | 920-9B210-00FN-0D0 | N/2 (N = 리프 스위치 수) |
| 최대 엔드포인트 | GPU 서버 | 최대 4,096개 (64포트 차수) |
| 이분 대역폭 | 전체 비차단 | 스파인 계층당 51.2Tb/s |
3. NVIDIA Mellanox 920-9B210-00FN-0D0의 역할 및 주요 기능
이 아키텍처 내에서 NVIDIA Mellanox 920-9B210-00FN-0D0는 기본 스위칭 요소 역할을 하며, 1절에서 식별된 요구 사항을 직접적으로 충족하는 몇 가지 중요한 기능을 제공합니다.
- 64개의 400Gb/s NDR 포트: 각 OSFP 포트는 안정적인 장거리 연결을 위해 순방향 오류 수정(FEC)을 지원하는 양방향 400Gb/s를 지원합니다. 51.2Tb/s의 총 스위칭 용량은 통신 집약적인 워크로드에도 충분한 여유를 제공합니다.
- 초저 컷스루 지연 시간: 920-9B210-00FN-0D0 데이터시트에 문서화된 대로 100ns 미만의 포트 간 지연 시간은 MPI 및 RDMA 작업에 대한 오버헤드를 최소화합니다.
- 통합 SHARPv3(확장 가능한 계층적 집계 및 축소 프로토콜): 호스트 CPU에서 집계 연산을 오프로드하여 대규모 작업에서 all-reduce 지연 시간을 최대 40%, all-to-all 지연 시간을 최대 35%까지 줄입니다.
- 적응형 라우팅 및 혼잡 제어: 핫스팟을 피하기 위해 트래픽을 동적으로 재라우팅하여 적대적인 트래픽 패턴에서 예측 가능한 성능을 보장합니다. 고급 원격 측정은 사전 관리 기능을 위한 플로우별 및 포트별 가시성을 제공합니다.
- 포괄적인 관리 용이성: 제로 터치 프로비저닝, 상태 모니터링 및 자동 장애 조치를 위해 NVIDIA의 통합 패브릭 관리자(UFM)와 완벽하게 통합됩니다.
920-9B210-00FN-0D0 사양은 또한 이중 중복 전원 공급 장치, 핫스왑 가능한 팬 모듈 및 중복 서브넷 관리자 구성 지원을 강조하여 미션 크리티컬 워크로드에 대해 99.999%의 가용성을 보장합니다.
4. 배포 및 확장성 권장 사항
920-9B210-00FN-0D0 InfiniBand 스위치 OPN 솔루션을 채택할 계획인 조직의 경우 다음 배포 지침을 권장합니다.
- 케이블링 전략: 랙 내 연결(최대 3m)에는 OSFP-to-OSFP DAC 케이블을 사용하고, 랙 간 및 스파인-리프 링크(최대 100m)에는 AOC 또는 광 트랜시버를 사용합니다. 신호 무결성 문제를 피하기 위해 모든 케이블이 920-9B210-00FN-0D0 호환인지 NVIDIA 호환성 매트릭스에 따라 확인합니다.
- 중복성: 별도의 PDU에 연결된 이중 전원 공급 장치를 배포합니다. 단일 장애 지점을 제거하기 위해 리프당 최소 두 개의 스파인 스위치를 사용합니다. 미션 크리티컬 워크로드의 경우 스파인 계층에서 N+1 중복성을 고려합니다.
- 펌웨어 관리: 모든 스위치가 동일한 NVIDIA 펌웨어 버전을 실행하는지 확인합니다. 다운타임 없이 롤링 업데이트를 위해 UFM의 자동 펌웨어 업그레이드 기능을 사용합니다. 배포 전에 호스트 어댑터 및 케이블과의 펌웨어 호환성을 검증합니다.
- 확장성 경로: 4,096개 이상의 노드를 초과하는 클러스터의 경우 3계층 폴디드 클로스 토폴로지로 전환하거나 적응형 라우팅을 활용합니다. 920-9B210-00FN-0D0는 단일 패브릭에서 최대 64개의 스위치를 지원하며, 더 큰 배포를 위해 게이트웨이를 통해 여러 패브릭이 상호 연결됩니다.
- 성능 검증: 프로덕션 배포 전에 OpenFabrics Enterprise Distribution(OFED) 성능 벤치마크와 같은 도구를 사용하여 포괄적인 스트레스 테스트를 실행하여 920-9B210-00FN-0D0 데이터시트 사양에 대해 패브릭 성능을 검증합니다.
총 소유 비용을 계산할 때 낮은 차수의 대안에 비해 스위치 계층 수 감소 및 케이블링 단순화를 고려하십시오. 단위당 920-9B210-00FN-0D0 가격은 HDR 스위치보다 높지만, 대규모 배포에서 포트당 비용 및 GPU당 네트워킹 비용은 훨씬 낮아 엑사스케일 프로젝트에 비용 효율적인 선택이 됩니다.
5. 운영, 모니터링 및 문제 해결
NDR 패브릭의 효과적인 관리를 위해서는 포괄적인 모니터링 및 문제 해결 프레임워크가 필요합니다. NVIDIA의 UFM은 전체 NVIDIA Mellanox 920-9B210-00FN-0D0-기반 패브릭에 대한 단일 창을 제공하며 다음을 제공합니다.
- 토폴로지 시각화: 모든 스위치, 링크 및 엔드포인트의 자동 검색 및 그래픽 표현, 실시간 상태 업데이트 포함.
- 성능 대시보드: 전체 패브릭에 걸쳐 포트 사용률, 오류율, 혼잡 지표 및 버퍼 점유율의 실시간 보기.
- 사전 경고: 링크 저하, 온도 이상, 전원 공급 장치 오류 및 케이블 마모에 대한 임계값 기반 경보.
- 결함 격리: 불량 케이블, 트랜시버 또는 스위치 포트를 식별하는 안내 문제 해결 워크플로, 해결 평균 시간(MTTR) 단축.
- 히스토리 분석: 과거 성능 데이터를 기반으로 한 추세 분석 및 용량 계획, 사전 확장 결정 지원.
고급 문제 해결을 위해 루프백 테스트, BER(비트 오류율) 분석 및 광학 모듈 진단 모니터링(DOM)을 포함한 스위치의 내장 진단 도구를 활용합니다. 초기 NDR 배포에서 발생하는 일반적인 문제는 불균등한 링크 속도, 잘못된 케이블 유형 또는 펌웨어 불일치로 인한 최적화되지 않은 라우팅을 포함합니다. 적응형 라우팅을 활성화하고, 모든 링크가 FEC가 활성화된 400Gb/s로 작동하는지 확인하고, 모든 스위치에서 일관된 펌웨어를 보장하면 대부분의 성능 이상이 해결됩니다.
네트워크 엔지니어는 또한 검증 단계에서 예상 지연 시간, 처리량 및 오류율을 포함한 920-9B210-00FN-0D0 사양의 기준선을 설정해야 합니다. 이 기준선에서 벗어나는 것은 잠재적인 문제의 조기 지표로 사용될 수 있습니다. 920-9B210-00FN-0D0 InfiniBand 스위치 OPN은 syslog 및 SNMP를 통한 포괄적인 이벤트 로깅도 지원하여 기존 데이터 센터 모니터링 스택과의 통합을 가능하게 합니다.
6. 요약 및 가치 평가
920-9B210-00FN-0D0는 NDR 기반 HPC 및 AI 클러스터를 구축하거나 확장하는 조직에게 매력적인 가치 제안을 제공합니다. 1U 폼 팩터에서 64개의 400Gb/s NDR 포트, 100ns 미만의 지연 시간, SHARPv3 오프로드, 엔터프라이즈급 관리 용이성 및 기존 HDR 생태계와의 완벽한 호환성을 제공합니다. 주요 가치 포인트는 다음과 같습니다.
- 성능: SHARPv3 오프로딩 및 NDR 대역폭을 통해 all-to-all 통신 지연 시간을 최대 75%, all-reduce 지연 시간을 최대 40%까지 줄입니다.
- 비용 효율성: 높은 차수와 감소된 스위치 계층 수로 인해 대규모 배포에서 HDR 대안에 비해 GPU당 네트워킹 비용이 낮습니다.
- 운영 단순성: 통합 관리, 자동 프로비저닝, 사전 모니터링 및 신속한 결함 해결을 위한 UFM과의 심층 통합.
- 투자 보호: 기존 HDR 케이블, 광학 장치 및 소프트웨어 스택과의 완벽한 호환성으로 프로덕션 워크로드를 중단하지 않고 단계적 업그레이드 가능.
- 미래 보장 확장성: 3계층 폴디드 클로스 및 dragonfly+ 토폴로지에 대한 지원으로 컴퓨팅 요구 사항이 증가함에 따라 패브릭을 8,000개 이상의 노드로 확장할 수 있습니다.
NVIDIA 채널 파트너를 통해 920-9B210-00FN-0D0 판매를 평가하는 조직의 경우, 자세한 920-9B210-00FN-0D0 데이터시트를 검토하고 인증된 솔루션 아키텍트와 협력하여 특정 워크로드 및 규모 요구 사항에 대한 설계를 검증하는 것이 좋습니다. NVIDIA Mellanox 920-9B210-00FN-0D0는 오늘날 프로덕션 준비가 되어 있으며 차세대 AI 및 HPC 혁신을 위한 고성능, 확장 가능한 상호 연결 기반을 제공합니다.

