NVIDIA Mellanox 920-9B210-00FN-0D0 기술 참조: 400Gb/s NDR 저지연 상호 연결 최적화
August 28, 2026
NVIDIA Mellanox 920-9B210-00FN-0D0 기술 참조: 400Gb/s NDR RDMA/HPC/AI 클러스터를 위한 낮은 지연성 상호 연결 최적화
1프로젝트 배경 및 요구사항 분석
인공지능 훈련 클러스터가 수천에서 수만 개의 GPU로 확장되고 HPC 시뮬레이션이 엑사스케일 성능에 접근함에 따라 네트워크 상호 연결은 전례없는 대역폭, 대기,그리고 결정론200Gb/s HDR에서 400Gb/s NDR로의 전환은 더 이상 선택 사항이 아닙니다. 그것은 트리리언 매개 변수 모델과 극대 규모의 병렬 컴퓨팅을 배포하는 조직에 대한 전략적 필요성입니다.여러 주요 배포 환경에서, 핵심 요구 사항은 다음과 같이 요약될 수 있습니다:
- 결정적 초저연속성:MPI와 모든 집단 통신은 교육 컨버전스에 대한 통신 상장 영향을 최소화하기 위해 100ns 이하의 포트-투-포트 지연을 유지해야합니다.
- 손실이 없는 직물:제로 패킷은 수천 개의 엔드포인트에 걸쳐 떨어집니다. RDMA 성능이 혼잡 상태에서 저하되지 않도록 보장합니다.
- 네트워크 내 계산 부하:공동 작업 (all-reduce, all-to-all, broadcast) 을 스위치 조직에 오프로드하여 호스트 CPU/GPU 자원을 자유롭게 합니다.
- 높은 라디크스 확장성:뚱뚱한 나무와 드래곤플라이 + 토폴로지를 지원합니다. 8,000+ 노드에서 전체 분단 대역폭.
- 투자 보호:단계적 업그레이드를 위한 기존 HDR 케이블, 광학 및 관리 도구와 원활한 호환성
이러한 요구사항을 충족시키기 위해 이 솔루션은NVIDIA 멜라노크스 920-9B210-00FN-0D0핵심 빌딩 블록으로 400Gb/s NDR 인피니밴드 스위치
2전체 네트워크 아키텍처 설계
제안된 솔루션은 두 계층의 잎 척추 토폴로지를 사용하여 결정적 지연과 단순화된 케이블링으로 확장 가능하고 차단되지 않는 조직을 제공합니다. 잎 층에서,각 컴퓨팅 랙은 하나 또는 두 가지로 장착됩니다.920-9B210-00FN-0D0 InfiniBand 스위치 OPN단위, OSFP 직결 구리 (DAC) 또는 활성 광 케이블 (AOC) 을 통해 GPU 서버에 400Gb / s NDR 연결 64 포트를 제공합니다.920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR이 스위치는 모든 잎 스위치를 서로 연결하여 전체 벡션 대역폭의 지방 나무 조직을 만듭니다.
5,000개의 노드를 초과하는 클러스터를 위해 3단계 접힌 클로스 아키텍처를 구현할 수 있습니다.920-9B210-00FN-0D0은 모든 수준에서 일관된 성능을 유지하기 위해 잎과 척추 역할을합니다.이 스위치는 단일 서브 네트워크 관리자 아래 하나의 조직에서 최대 64개의 스위치를 지원하며, 대규모 토폴로지의 통일된 관리를 가능하게 합니다.
다음 표는 920-9B210-00FN-0D0을 중심으로 구축된 2층 NDR 직물의 주요 확장 매개 변수를 요약합니다.
| 구성 요소 | 사양 | 가치 |
|---|---|---|
| 잎 스위치 | 920-9B210-00FN-0D0 | 1 푼 2 푼 |
| 척추 스위치 | 920-9B210-00FN-0D0 | N/2 (N = 잎 스위치 수) |
| 최대 최종점 | GPU 서버 | 최대 4,096 (64포트 근) |
| 이분열 대역폭 | 완전히 차단되지 않는 | 51척추 층당 2 Tb/s |
3. NVIDIA Mellanox 920-9B210-00FN-0D0의 역할 및 주요 기능
이 건축물 안에서,NVIDIA 멜라노크스 920-9B210-00FN-0D0기본 전환 요소로서 기능이 제공되며, 1부에서 확인된 요구 사항을 직접적으로 해결하는 여러 가지 중요한 기능을 제공합니다.
- 400Gb/s NDR 64개의 포트:각 OSFP 포트는 신뢰할 수 있는 확장 범위를 연결하기 위해 앞으로의 오류 수정 (FEC) 으로 양방향 400Gb / s를 지원합니다. 총 스위칭 용량은 51.2 Tb/s는 가장 통신이 많은 작업량에도 충분한 앞을 제공합니다..
- 극저단 절단 지연:포트에서 포트까지의 지연시간은 100ns 이하입니다.920-9B210-00FN-0D0 데이터 시트, MPI와 RDMA 운영에 대한 최소한의 상용 비용을 보장합니다.
- 통합된 SHARPv3:호스트 CPU에서 집단 작업을 오프로드하여 최대 40%까지 모든 감소 대기 시간을 줄이고 대용량 작업에서 최대 35%까지 모든 것을 줄입니다.
- 적응적인 라우팅 및 혼잡 제어:역동적으로 교통을 전환하여 핫스팟을 피하고 적대적인 교통 패턴에서 예측 가능한 성능을 유지합니다.첨단 텔레메트리는 능동적인 관리를 위해 흐름 및 항구별 가시성을 제공합니다..
- 전체 관리 가능성:NVIDIA의 유니피드 팩브릭 매니저 (UFM) 와 완전한 통합, 무터치 프로비저닝, 건강 모니터링, 자동화 오류 전환.
의920-9B210-00FN-0D0 사양또한 이중 리던스 전원 공급 장치, 핫 스?? 핑 가능한 팬 모듈 및 리던스 서브 네트워크 관리자 구성에 대한 지원, 미션 크리티컬 워크 로드에서 99.999% 가용성을 보장합니다.
4배포 및 확장성 권고
조직이 도입을 계획하는 경우920-9B210-00FN-0D0 InfiniBand 스위치 OPN 솔루션, 다음과 같은 배치 지침이 권장됩니다:
- 케이블 전략:OSFP에서 OSFP DAC 케이블을 랙 내부 연결 (최고 3m) 및 AOC 또는 광 수신기를 랙 간 및 척추 잎 링크 (최고 100m) 에 사용하십시오. 모든 케이블이 있는지 확인합니다.920-9B210-00FN-0D0 호환NVIDIA 호환성 매트릭스에 따라 신호 무결성 문제를 피합니다.
- 퇴직자:분리된 PDU에 연결된 이중 전원 공급을 배치합니다. 단점 장애를 제거하기 위해 잎당 적어도 두 개의 척추 스위치를 사용하십시오.척추 층에서 N+1 과잉을 고려.
- 펌웨어 관리:모든 스위치가 동일한 NVIDIA 펌웨어 버전을 실행하는지 확인하십시오. 다운타임 없이 롤링 업데이트를 위해 UFM의 자동 펌웨어 업그레이드 기능을 사용하십시오.배포 전에 호스트 어댑터와 케이블과 펌웨어 호환성을 검증.
- 확장성 경로:4,096 노드 이상의 클러스터를 위해, 3단계 접힌 클로스 토폴로지 또는 적응 라우팅을 가진 레버리지 드래곤플라이 +로 전환합니다. 920-9B210-00FN-0D0은 단일 조직에서 최대 64 개의 스위치를 지원합니다.더 큰 배포를 위해 게이트웨이를 통해 상호 연결된 여러 개의 직물.
- 성능 검증:생산 도입 전에, OpenFabrics Enterprise Distribution (OFED) 성능 벤치마크를 사용하여 전체적인 스트레스 테스트를 실행하여920-9B210-00FN-0D0 데이터 시트사양
전체 소유 비용을 계산 할 때, 낮은 라디크스 대안에 비해 스위치 계층 및 단순화 된 케이블의 감소 수를 고려하십시오.920-9B210-00FN-0D0 가격단위당 HDR 스위치보다 높고, 포트당 비용과 GPU당 네트워크 비용은 대규모 배포에서 현저히 낮으며, 이는 엑사스케일 프로젝트에 대한 비용 효율적인 선택이 됩니다.
5운영, 모니터링 및 문제 해결
NDR 섬유의 효과적인 관리는 포괄적인 모니터링 및 문제 해결 프레임 워크가 필요합니다.NVIDIA 멜라노크스 920-9B210-00FN-0D0- 직물 원료:
- 토폴로지 시각화:모든 스위치, 링크 및 엔드포인트의 자동 발견 및 그래픽 표현, 실시간 상태 업데이트
- 성능 대시보드:항구 사용량, 오류율, 혼잡 지표 및 전체 조직에서 버퍼 점유율의 실시간 조회.
- 선제적 경보:연결 고장, 온도 이상, 전력 공급 고장, 케이블 마모를 위한 임계 기반 경보
- 결함 격리:고장있는 케이블, 트랜시버 또는 스위치 포트를 식별하는 가이드된 문제 해결 워크플로우, 중간에 해결 시간을 줄입니다.
- 역사 분석:트렌드 분석과 역대 성과 데이터를 기반으로 한 용량 계획, 선제적인 확장 결정을 가능하게 합니다.
고급 문제 해결을 위해 루프백 테스트, BER (비트 오류율) 분석 및 광 모듈 진단 모니터링 (DOM) 을 포함한 스위치의 내장 진단 도구를 활용하십시오.초기 NDR 배포에서 발견되는 일반적인 문제는 불평등한 링크 속도로 인해 발생하는 최적 이하의 라우팅을 포함합니다., 부적절한 케이블 유형 또는 펌웨어 불일치성. 적응 라우팅을 가능하게 하며, 모든 링크가 FEC가 활성화된 상태에서 400Gb/s로 작동하는지 확인합니다.그리고 모든 스위치에서 일관된 펌웨어를 보장하면 대부분의 성능 이상 문제가 해결됩니다..
네트워크 엔지니어들은 또한920-9B210-00FN-0D0 사양검증 단계에서 예상된 지연, 처리량 및 오류 비율을 포함하여. 이 기준선에서 벗어나는 것은 잠재적 인 문제의 초기 지표로 사용될 수 있습니다.920-9B210-00FN-0D0 InfiniBand 스위치 OPN또한 syslog 및 SNMP를 통해 포괄적인 이벤트 로깅을 지원하여 기존 데이터 센터 모니터링 스택과 통합을 가능하게합니다.
6요약 & 가치 평가
의920-9B210-00FN-0D0NDR 기반의 HPC 및 AI 클러스터를 구축하거나 확장하는 조직에 매력적인 가치 제안을 제공합니다.엔터프라이즈 수준의 관리성, 그리고 기존 HDR 생태계와 완전한 호환성 1U 플랫폼에서 모든 컴팩트.
- 성능:SHARPv3 오프로드와 NDR 대역폭을 통해 모든-모든 통신의 지연시간을 75%까지 줄이고 모든-감소 지연시간을 40%까지 줄입니다.
- 비용 효율성대규모 배포에서 HDR 대안에 비해 GPU 당 네트워크 비용이 더 낮으며, 더 높은 라디크스와 스위치 계층 수 감소로 인해 발생합니다.
- 작동 단순성:통일 관리, 자동 프로비저닝, 능동적 모니터링 및 빠른 오류 해결을 위해 UFM와 깊은 통합.
- 투자 보호:기존 HDR 케이블, 광학 및 소프트웨어 스택과 완전한 호환성, 생산 작업 부하를 방해하지 않고 단계적 업그레이드를 가능하게합니다.
- 미래형 확장성:3단계 접힌 클로스 및 드래곤플라이+ 토폴로지를 지원하여 컴퓨팅 요구가 증가함에 따라 조직이 8,000+ 노드로 확장될 수 있습니다.
평가하는 조직의 경우920-9B210-00FN-0D0 판매NVIDIA의 채널 파트너를 통해920-9B210-00FN-0D0 데이터 시트그리고 인증된 솔루션 아키텍트와 협력하여 특정 작업량 및 규모 요구 사항에 대한 디자인을 검증합니다.NVIDIA 멜라노크스 920-9B210-00FN-0D0현재 생산 준비가 되어 있으며, 차세대 인공지능과 HPC 혁신을 위한 고성능, 확장 가능한 상호 연결 기반을 제공합니다.

