NVIDIA Mellanox 920-9B110-00FH-0D0 실제 적용: HPC 및 AI 클러스터를 위한 저지연 RDMA 패브릭 최적화
August 25, 2026
실무에서 NVIDIA Mellanox 920-9B110-00FH-0D0: HPC 및 AI 클러스터를 위한 저연속 RDMA 패브릭을 최적화
배경과 도전: HDR 성능이 예산 현실과 일치할 때
중견 규모의 AI 연구실이 최근에 익숙한 도전을 직면했습니다. 그들의 기존 100Gb/s EDR InfiniBand 패브릭은NVIDIA A100 노드 128에서 512로 증가했습니다.대규모 트랜스포머 모델에 대한 훈련 시간은 모든 환원 작업 중 네트워크 혼잡으로 인해 40% 이상 증가했습니다.그리고 팀은 400Gb/s NDR 배포에 필요한 자본 지출 없이 상당한 성능 향상을 제공할 수 있는 업그레이드가 필요했습니다..
연구실에서는 여러 가지 옵션을 평가하고 200Gb/s HDR를 성능과 비용의 이상적인 균형으로 결정했습니다. 그러나 그들은 높은 포트 밀도를 제공할 수 있는 스위치가 필요했습니다.고급 혼잡 제어, 그리고 기존 HDR 호환 케이블과 트랜시버와 원활한 통합.NVIDIA 멜라녹스 920-9B110-00FH-0D0HDR가 과도한 공급 없이 충분한 대역폭을 제공하는 환경을 위해 특별히 만들어진 스위치입니다.
솔루션 및 배포: 비용 최적화 HDR 패브릭
실험실에서는920-9B110-00FH-0D0 InfiniBand 스위치 OPN각 컴퓨팅 랙은 MQM8790-HS2F 기반의 스위치를 받았습니다.920-9B110-00FH-0D0 MQM8790-HS2F 200Gb/s HDROSFP-OSFP 직결 케이블을 통해 GPU 서버에 200Gb/s 연결성을 제공하는 40개의 포트. 척추 층에서 4개의 추가 920-9B110-00FH-0D0 스위치가 모든 잎 스위치를 상호 연결합니다.전체 빗방울 대역폭을 가진 막지 않는 지방 나무 직물을 만드는 것.
이 배포가 특히 효과적이었던 것은 스위치의 통합된 SHARPv2 (Scalable Hierarchical Aggregation and Reduction Protocol) 기술이었습니다.이는 집단 커뮤니케이션 작업을 스위치 조직에 직접 배포했습니다.실제로 이것은 이전에는 상당한 호스트 CPU 주기와 네트워크 대역폭을 소비했던 모든 줄이 작업을 의미했습니다.이제 직물 전체에 한 번 통과하여 작업 완료 시간을 극적으로 줄였습니다..
에 따르면920-9B110-00FH-0D0 데이터 시트, 스위치는 연구소의 성능 요구 사항에 밀접하게 일치하는 200ns 이하의 절단 지연을 제공합니다. 엔지니어링 팀은 또한920-9B110-00FH-0D0 호환이 생태계에는 이미 표준화된 모든 케이블 종류와 광학이 포함되었고, 비용이 많이 드는 재케이블 작업의 필요성이 없어졌습니다.
결과와 측정 가능한 이득: 곤경에서 지원자로
임무를 수행한 후, 실험실에서는 몇 가지 중요한 차원에서 개선점을 측정했습니다.
- 작업 완료 시간 단축:13B 매개 변수 모델의 훈련 반복은 35% 감소했으며 일반적인 집단 크기에 대해 모든 감소 지연시간이 12μs에서 5μs 이하로 떨어졌습니다.
- 네트워크 사용량:스위치의 적응성 라우팅 및 혼잡 제어 메커니즘 덕분에 혼잡을 유발하지 않고 평균 직물 활용도가 58%에서 83%로 증가했습니다.
- 전력 및 냉각 효율:이전 EDR 조직과 비교하면 새로운 HDR 인프라는 포트당 전력 소비를 30% 감소시켜 데이터 센터 전력 예산을 초과하지 않고 더 많은 컴퓨팅 노드를 추가 할 수 있습니다.
전체 소유비용 관점에서,920-9B110-00FH-0D0 가격NDR 대안보다 훨씬 낮았으며, 실험실이 기존 예산 내에서 전체 조직을 업그레이드 할 수있었습니다.920-9B110-00FH-0D0 사양또한 스위치의 이중 리던던트 전원 공급 장치와 핫스?? 핑 가능한 팬 모듈을 강조했습니다. 이는 생산 훈련 작업에 99.999%의 가용성을 달성하는 실험실 목표에 기여했습니다.
네트워크 엔지니어들은920-9B110-00FH-0D0 InfiniBand 스위치 OPN 솔루션NVIDIA의 유니파이드 패브릭 매니저 (UFM) 와 원활하게 통합되어, 섬유 건강과 자동 알림을 중앙 집중적으로 확인할 수 있습니다.이것은 문제 해결 및 능동적 인 유지 보수에 소요되는 시간을 크게 줄였습니다., 네트워크 관리보다는 훈련 파이프 라인을 최적화하는 데 집중할 수 있도록 팀을 자유롭게합니다.
요약 & 전망: 올바른 크기의 HDR 재단
의NVIDIA 멜라녹스 920-9B110-00FH-0D0이 연구실의 올바른 선택이었죠. 200Gb/s HDR의 성능을 비즈니스에 합당한 비용 구조로 제공했습니다.네트워크 내 컴퓨팅 기능, 그리고 강력한 관리 기능, 실험실은 그들의 네트워크를 성능의 병목에서 미래 성장의 확장 가능한 기초로 바꾸었습니다.
앞으로 연구실에서는 향후 18개월 동안 클러스터를 1,024개의 노드로 확장할 계획입니다.그들은 네트워크가 컴퓨팅 능력과 함께 성장할 수 있다고 확신합니다.HDR 인프라 옵션을 평가하는 조직의 경우920-9B110-00FH-0D0 판매NVIDIA의 채널 파트너를 통해 성능, 밀도 및 비용을 균형 잡는 매력적이고 생산 검증 된 솔루션을 제공합니다.

