Mellanox(NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand 스위치 실습
July 15, 2026
Mellanox(NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand 스위치 실습 | RDMA/HPC/AI 클러스터를 위한 저지연 상호 연결 최적화
배경 및 과제: 클러스터 규모가 상호 연결 병목 현상을 충족하는 경우
선도적인 인터넷 기업의 AI 연구 부서는 익숙한 기로에 서 있었습니다. 여러 랙에 걸쳐 있고 대규모 언어 모델 훈련에 점점 더 많이 사용되는 GPU 서버의 증가는 예측할 수 없는 작업 완료 시간으로 인해 어려움을 겪고 있었습니다. 기존 이더넷 기반 패브릭은 범용 워크로드에는 적합하지만 분산 교육의 동기화된 버스트 트래픽 패턴을 처리할 수 없었습니다. 전체 축소 작업은 패킷 삭제 및 인캐스트 정체로 인해 정기적으로 중단되어 훈련 주기가 며칠에서 몇 주로 늘어나게 됩니다. 인프라 팀은 백엔드 네트워크가 RDMA 트래픽을 처리하는 방식에 근본적인 변화가 필요했으며 전체 데이터 센터 아키텍처를 정밀 검사하지 않고도 이를 필요로 했습니다.
솔루션 설계: 920-9B210-00FN-0D0 InfiniBand 스위치 배포 OPN
여러 상호 연결 옵션을 평가한 후 팀은 다음을 선택했습니다.멜라녹스(NVIDIA Mellanox) 920-9B210-00FN-0D0새로운 백엔드 패브릭의 초석이 되었습니다. 배포는 2계층 리프-스파인 토폴로지를 중심으로 이루어졌으며 각 리프 스위치는 400Gb/s 링크를 통해 최대 40개의 GPU 노드를 연결했습니다. 그만큼920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR비차단 아키텍처와 통합 SHARPv3 네트워크 내 컴퓨팅 기능을 위해 특별히 변형이 선택되었습니다. 이를 통해 팀은 집단 통신 작업을 스위치 패브릭으로 직접 오프로드하여 CPU 오버헤드를 줄이고 실제 계산을 위한 GPU 사이클을 확보할 수 있었습니다.
물리적 배포 측면에서 스위치는 기존 열기 통로/냉기 통로 구성과 일치하도록 앞에서 뒤로 공기 흐름이 흐르도록 설치되었습니다. 팀은 다음을 활용했습니다.920-9B210-00FN-0D0 데이터시트전력 및 냉각 요구 사항을 확인하고 기존 배전 장치에 원활하게 통합되도록 합니다. 케이블링은 QSFP-DD 트랜시버를 사용하여 일관성을 유지했습니다.920-9B210-00FN-0D0 호환최대 100미터에 이르는 척추-리프 연결을 포함하여 전체 링크 예산에 걸쳐 검증된 광학 장치입니다.
배포 접근 방식: 단계별 통합
- 1단계 – 실험실 검증:8개의 GPU 노드와 2개의 스위치로 구성된 소규모 테스트베드를 사용하여 대기 시간과 처리량을 벤치마킹했습니다. 그만큼엔비디아 멜라녹스 920-9B210-00FN-0D0이전 HDR 세대에 비해 60% 향상된 600ns 미만의 스위치 지연 시간을 보여주었습니다.
- 2단계 – 단계적 출시:팀은 링크 상태와 정체 지표를 실시간으로 모니터링하기 위해 NVIDIA의 Unified Fabric Manager를 사용하여 한 번에 하나의 트레이닝 포드를 마이그레이션했습니다. 이를 통해 진행 중인 프로덕션 작업 부하에 대한 중단을 최소화했습니다.
- 3단계 – 전체 규모 통합:18개의 스위치는 모두 3개의 랙에 배포되어 400Gb/s 업링크를 갖춘 완전한 비차단 스파인을 형성했습니다. 트래픽의 균형을 동적으로 조정하고 최대 작업 제출 중에 초과 구독을 방지하기 위해 적응형 라우팅이 활성화되었습니다.
배포 전반에 걸쳐 엔지니어링 팀은 포괄적인 내용을 참조했습니다.920-9B210-00FN-0D0 사양버퍼 설정 및 혼잡 제어 매개변수를 미세 조정합니다. 스위치의 고급 원격 측정 기능은 포트당 오류 수 및 링크 활용도에 대한 세부적인 가시성을 제공하여 사전 유지 관리 및 용량 계획을 가능하게 했습니다.
측정 가능한 결과 및 운영상의 이점
본격적인 배포 후 2주 만에 개선 사항이 눈에 띄게 나타났습니다. 표준 1,024-GPU 교육 작업의 전체 감소 완료 시간은 12.3초에서 7.8초로 단축되어 통신 오버헤드가 37% 감소했습니다. 일반적인 GPT 스타일 모델의 작업 완료 시간이 거의 30% 향상되어 연구팀이 더 빠르게 반복하고 주당 더 많은 실험을 실행할 수 있게 되었습니다. 내장된 SHARPv3 엔진은 집단 작업의 평균 18%를 오프로드하여 훈련 실행당 GPU 활용도를 높이고 에너지 소비를 낮췄습니다.
운영 측면에서 IT 팀은 네트워크 관련 작업 실패가 줄어들고 링크 수준 문제를 진단하는 데 소요되는 시간이 크게 줄었다고 보고했습니다. 그만큼920-9B210-00FN-0D0 InfiniBand 스위치 OPN 솔루션3개월의 관찰 기간 동안 계획되지 않은 가동 중단이 전혀 발생하지 않는 등 매우 안정적인 것으로 나타났습니다. 통합 관리 인터페이스는 이제 단일 창을 통해 전체 패브릭을 관리할 수 있는 네트워크 운영 팀의 학습 곡선을 줄였습니다.
비용 및 조달 고려 사항
초기 동안920-9B210-00FN-0D0 가격스위치를 시장의 고급 쪽에 배치한 결과, 총 소유 비용 분석은 다른 이야기를 들려주었습니다. 작업 완료 시간을 줄이고 GPU 활용률을 개선함으로써 조직은 동일한 컴퓨팅 용량에 대해 클라우드 인스턴스 비용을 22% 절감했습니다. 더욱이,920-9B210-00FN-0D0 판매여러 채널 파트너를 통해 경쟁 입찰이 가능해졌으며 NVIDIA Mellanox의 장기적인 지원 약속은 투자에 대한 확신을 제공했습니다.
요약 및 전망: 차세대 AI 인프라를 위한 청사진
배포멜라녹스(NVIDIA Mellanox) 920-9B210-00FN-0D0이 대규모 AI 연구 시설은 유사한 상호 연결 문제에 직면한 조직을 위한 강력한 참조 아키텍처 역할을 합니다. 400Gb/s NDR 속도, 마이크로초 미만의 대기 시간 및 네트워크 내 컴퓨팅 기능의 조합은 RDMA 기반 HPC 및 AI 클러스터의 핵심 문제점을 해결합니다. 네트워크 설계자는 다음의 유연성을 높이 평가할 것입니다.920-9B210-00FN-0D0 InfiniBand 스위치 OPNIT 관리자는 강력한 관리 도구와 포괄적인 기능을 사용할 수 있습니다.920-9B210-00FN-0D0 데이터시트용량 계획을 위한 것입니다.
앞으로 조직은 추가 스토리지 오프로드 및 보안 격리를 위한 BlueField-3 DPU 통합을 포함하여 더 큰 GPU 클러스터를 지원하기 위해 패브릭을 확장할 계획을 이미 세우고 있습니다. 그만큼920-9B210-00FN-0D0 호환에코시스템은 최신 NIC이든 광학 기술이든 향후 업그레이드가 원활하게 지원되도록 보장합니다. 대규모 AI 또는 HPC 워크로드를 배포하는 모든 기업의 경우 이 스위치는 점진적인 업그레이드일 뿐만 아니라 규모에 맞는 성능을 기본적으로 구현하는 도구입니다.

