Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand 스위치 기술 솔루션
July 15, 2026
멜라녹스 (NVIDIA 멜라녹스) 920-9B210-00FN-0D0 인피니밴드 스위치 기술 솔루션
1프로젝트 배경 및 요구사항 분석
현대 인공지능 교육 프레임워크와 HPC 애플리케이션은 컴퓨팅 밀도만 아닌 네트워크 상호 연결 성능에 의해 점점 더 제한됩니다.분산된 교육 일자리, 특히 큰 언어 모델을 사용하는 일자리, 전통적인 이더넷 패브릭을 압도하는 동기화 된 모든 감소 및 모든 모든 트래픽 패턴. 기업 배포에 걸쳐 식별 된 주요 요구 사항에는 다음이 포함됩니다.통신 오버헤드를 최소화하기 위해 미세초 이하의 스위치 지연, 과잉 구독을 없애기 위해 규모에서 차단되지 않는 처리량,그리고 컨버지드 이더넷 (RoCE) 또는 네이티브 인피니밴드 생태계를 통해 RDMA와 원활한 통합또한, 운영 팀들은 수백 개의 항구에서 능동적인 오류 탐지 및 단순화된 관리를 위해 심층적인 텔레메트리를 요구합니다.
2전체 네트워크/시스템 아키텍처 설계
제안된 아키텍처는 GPU 중심의 워크로드를 위해 특별히 구축된 2단계 잎 척추 토폴로지에 초점을 맞추고 있습니다. 잎 계층에서 각 랙에는멜라녹스 (NVIDIA 멜라녹스) 920-9B210-00FN-0D0주요 ToR (Top-of-Rack) 스위치로 400Gb/s NDR 링크를 통해 최대 40 개의 컴퓨팅 노드를 연결합니다. 척추 층은920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR스위치, 4: 1 오버 서브스크립션 또는 충분한 스핀 포트를 배치하면 완전히 차단하지 않는 풀 메시 연결을 제공합니다.이 디자인은 하나의 직물 도메인에서 최대 512 GPU 노드를 지원합니다, NVIDIA의 UFM (Unified Fabric Manager) 를 통해 상호 연결된 여러 서브넷을 통해 수평적으로 확장 할 수있는 옵션.
이 아키텍처는 NVIDIA의 SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) 인 네트워크 컴퓨팅 엔진을 활용하여 스위치 ASIC에 직접 집단 작업을 오프로드합니다.이것은 CPU/GPU 메모리 버스를 통과하는 데이터의 양을 줄이고 소프트웨어 기반 접근 방식에 비해 40%까지 집단 운영 지연 시간을 줄입니다..920-9B210-00FN-0D0 InfiniBand 스위치 OPN또한 적응형 라우팅을 지원하며, 패킷별로 역동적으로 최소 혼잡 경로를 선택하여 비대칭 트래픽 부하에서도 최적의 대역폭 활용을 보장합니다.
3솔루션에서 920-9B210-00FN-0D0의 역할과 주요 특징
의NVIDIA 멜라노크스 920-9B210-00FN-0D0전체 상호 연결 조직의 기본 빌딩 블록으로 작용합니다. 주요 역할은 다음을 포함합니다.
- 고밀도 집합:최대 64 개의 비 차단 400Gb / s 포트를 2U 형식 인자로, 스위치는 25.6 Tb / s의 총 스위칭 용량을 제공합니다. 이 밀도는 랙 당 필요한 스위치 수를 줄입니다.케이블을 간소화하고 포트당 전력 소비를 낮추는 것.
- 초저연속 스위칭:스위치는 모든 패킷 크기에 대해 600ns 이하의 지연 시간을 유지하며, 온라인 추론 및 금융 HPC와 같은 꼬리 지연에 민감한 응용 프로그램에 매우 중요합니다.
- 네트워크 컴퓨팅:SHARPv3 통합은 집단 작업의 하드웨어 가속화를 가능하게 하며, 조직을 가로질러 통로의 수를 줄이고 전체 작업 완료 시간을 최대 30% 향상시킵니다.
- 첨단 텔레미터 및 혼잡 제어:이 스위치는 흐름에 대한 가시성을 제공하며 호스트 측 조정을 위해 혼잡한 스트림을 표시하고 시작되는 핫스팟에 대한 조기 경고를 가능하게합니다.
에 따르면920-9B210-00FN-0D0 데이터 시트, 스위치는 구리 및 광학 QSFP-DD 트랜시버를 모두 지원합니다.920-9B210-00FN-0D0 호환대부분의 데이터 센터의 기존 케이블 인프라와 함께. 앞에서 뒤로의 공기 흐름과 부재 전원 공급 장치가 기업 환경에서 높은 가용성을 보장합니다.
4배포 및 확장 권고 (유형 토폴로지)
128개의 GPU 노드의 그린필드 배포를 위해, 우리는 4개의 잎 스위치와 2개의 척추 스위치로 2단계 구조를 추천합니다.각 척추는 4x400Gb/s 업링크를 통해 각 잎과 연결됩니다.대부분의 교육 작업 부하에 허용되는 1:1 과잉 구독 비율입니다. 지연 감수성 또는 대역폭 응용 프로그램에서는 1:1 비 차단 디자인은 척추 수를 4으로 증가시켜 달성 할 수 있습니다., 다운링크 포트와 동등한 종합 업링크 용량을 제공합니다.
512 노드를 초과하기 위해서는 여러 서브넷으로 조직을 분할해야 하며, 각각의 서브넷은 UFM에 의해 개별적인 조직 섬으로 관리된다.인터 서브넷 통신은 NVIDIA의 퀀텀-2 게이트웨이 또는 호스트 기반 라우팅을 통해 라우팅 될 수 있습니다., 비록 성능에 민감한 작업 부하에 대한 권장 접근법은 가능한 한 하나의 하위 네트워크 내에서 조직을 유지하는 것입니다.920-9B210-00FN-0D0 사양이러한 대규모 토폴로지를 지원하며, 경로 재중계 이벤트 중 패킷 떨어지는 것을 방지하기 위해 내장 흐름 제어 및 우선 순위 기반 흐름 제어 (PFC) 를 제공합니다.
물리적 케이블링을 계획 할 때 케이블 밀도를 줄이기 위해 척추 잎 연결에 MPO-to-QSFP-DD 브레이크아웃 케이블 또는 3 미터 이상의 거리에 활성 광학 케이블 (AOC) 을 사용하는 것을 고려하십시오.920-9B210-00FN-0D0 판매일반적으로 포괄적인 액세서리 키트를 포함하지만 링크 트레이닝 문제를 피하기 위해 공급자의 상호 운용성 매트릭스를 통해 제3자 트랜시버 호환성을 검증하는 것이 좋습니다.
5- 운영, 모니터링 및 오류 진단
운영의 우수성은920-9B210-00FN-0D0 InfiniBand 스위치 OPN 솔루션. 스위치는 NVIDIA의 UFM 플랫폼과 원활하게 통합됩니다.
- 실시간 직물 건강 모니터링:연결 상태, 온도, 전력 소비 및 포트별 오류 카운터 (CRC, 기호 및 정렬 오류) 를 위한 대시보드
- 예측 실패 분석:UFM의 기계 학습 모델은 실패한 광학이나 손상된 링크를 작업 실패를 유발하기 전에 능동적으로 식별합니다.
- 자동 문제 해결:이 시스템은 트래픽을 재중선하거나 결함된 링크를 격리하는 등의 교정 조치를 권장하여 평균 해결 시간 (MTTR) 을 크게 줄입니다.
고급 진단에 대한 스위치는 sFlow 및 포트 미러링을 지원하며 프로토콜 수준의 디버깅을 위해 깊은 패킷 검사를 가능하게합니다. 팀 또한 자세한 액세스 할 수 있습니다.920-9B210-00FN-0D0 사양버퍼 임계와 권장 설정, 특히 혼합된 InfiniBand/Ethernet 환경에서 사용되는 경우 RoCEv2 트래픽을 조정하기 위해.성능 조정은 적응적 라우팅 임계값과 SHARPv3 집계 간격에 초점을 맞추어야 합니다., 예를 들어 작업 부하 단계별로 조정 할 수 있습니다.
루틴 유지보수에는 펌웨어 업데이트가 포함됩니다. UFM의 롤링 업그레이드 기능을 사용하여 최소한의 장애로 수행됩니다.신호 무결성을 유지하기 위해 광 연결 장치의 주기적인 청소스위치의 과잉 전력 및 팬 모듈은 작동 중 핫스변을 대체 할 수 있습니다.
6요약 & 가치 평가
의멜라녹스 (NVIDIA 멜라녹스) 920-9B210-00FN-0D0인공지능 및 HPC 투자의 완전한 성능을 누릴 수 있는 조직을 위한 포괄적인 솔루션을 제공합니다. 400Gb/s NDR 속도, 네트워크 컴퓨팅,그리고 지능형 혼잡 관리, 확장 가능한 플랫폼, 그것은 오늘날의 데이터 센터가 직면 한 가장 시급한 상호 연결 과제를 해결합니다. 설명 된 아키텍처는 128-노드 파일럿 클러스터에서 2,400 노드까지 검증 된 경로를 제공합니다.1000+ 노드 슈퍼컴퓨터 직물, 경영을 단순화하고 전체 소유 비용을 줄이는 운영 도구.
그 결과,920-9B210-00FN-0D0 가격, 장기적 가치를 고려하십시오: 작업 완료 시간이 줄어드는 것은 클라우드 비용의 감소 또는 현장 작업 부하에 대한 더 빠른 통찰력으로 직접 번역됩니다.920-9B210-00FN-0D0 InfiniBand 스위치 OPN 솔루션NVIDIA의 글로벌 지원 네트워크와 광범위한 파트너 생태계가 뒷받침하여 조직이 향후 몇 년 동안 자신있게 인프라를 배포하고 확장하고 최적화 할 수 있습니다.
자세한 계획 내용은 공무원920-9B210-00FN-0D0 데이터 시트그리고920-9B210-00FN-0D0 사양기계 도면, 열 프로파일, 성능 기준을 포함하는 문서.

