애플리케이션 실습: NVIDIA Mellanox MCX631102AN-ADAT – RDMA/RoCE 저지연 전송 및 서버 처리량 향상
April 27, 2026
분산 스토리지, 고성능 컴퓨팅 및 AI 학습 클러스터에서 네트워크 지연 시간과 CPU 오버헤드는 서버 성능을 제한하는 주요 병목 현상이 되었습니다. 한 클라우드 서비스 제공업체는 최근 NVIDIA Mellanox MCX631102AN-ADAT 서버 어댑터를 선택하여 NVMe-oF 스토리지 백엔드를 업그레이드했습니다. Converged Ethernet(RoCEv2)을 통한 RDMA를 배포함으로써 종단 간 낮은 지연 시간 전송과 상당한 서버 처리량 증가를 달성했습니다. 이 사례 연구는 프로덕션 환경에서 어댑터의 성능을 살펴봅니다.
배경 및 과제: TCP/IP 프로토콜 스택 병목 현상
이 제공업체의 기존 25GbE 인프라는 기존 TCP/IP 소프트웨어 스택을 사용하여 스토리지 트래픽을 처리했습니다. NVMe/TCP 시나리오에서 패킷 캡슐화 및 역캡슐화에 대한 CPU 사용률은 40%를 초과하여 스토리지 지연 시간이 200µs 이상으로 증가하고 애플리케이션 서버의 컴퓨팅 용량이 심각하게 감소했습니다. 아키텍트는 커널 네트워크 스택을 우회하고 CPU 간섭을 줄이며 듀얼 25GbE 링크에서 라인 속도 처리량을 유지할 수 있는 솔루션을 시급히 필요로 했습니다. 여러 옵션을 평가한 후 스토리지 패브릭 개조의 핵심 하드웨어로 MCX631102AN-ADAT ConnectX-6 Lx 듀얼 포트 25GbE SFP28을 선택했습니다.
솔루션 및 배포: 하드웨어 오프로드를 통한 RDMA/RoCEv2
배포는 ECN 및 PFC를 사용하는 RoCEv2 무손실 모드에서 실행되는 MCX631102AN-ADAT 이더넷 어댑터 카드로 모든 스토리지 대면 서버를 교체했습니다. 주요 배포 단계는 다음과 같습니다.
- SR-IOV를 활성화하고 스토리지 가상 머신에 가상 기능(VF)을 할당하여 하이퍼바이저 네트워크 스택 우회
- RDMA 전송을 사용하여 NVMe over Fabrics(NVMe-oF) 구성, TCP 오버헤드 완전히 제거
- 리프-스파인 토폴로지 전반에 걸쳐 무손실 25GbE RoCE 트래픽에 대한 스위치 버퍼 임계값 조정
MCX631102AN-ADAT 사양 — 하드웨어 타임스탬프, 동적 연결 전송(DCT) 및 벡터화된 수신 엔진 포함 — 은 50Gbps 집계 부하에서도 예측 가능한 마이크로초 미만의 지연 시간을 보장하기 위해 완전히 활용되었습니다.
측정된 성능 향상 및 운영 이점
NVIDIA Mellanox MCX631102AN-ADAT 기반 패브릭으로 마이그레이션한 후 다음과 같은 지표가 캡처되었습니다.
| 지표 | 이전(TCP/IP 25GbE) | 이후(RoCEv2 및 MCX631102AN-ADAT) |
|---|---|---|
| NVMe-oF 읽기 지연 시간(P99) | 215 µs | 18 µs |
| CPU 사용률(스토리지 I/O 경로) | 41%(단일 코어 포화) | 7%(코어 분산) |
| 집계 서버 처리량(RX+TX) | 42Gbps(소프트웨어 제한) | 49.8Gbps(라인 속도) |
| 작은 패킷(64B) 처리량 | 8.1Mpps | 37.5Mpps(하드웨어 흐름 제어) |
엔지니어들은 MCX631102AN-ADAT 이더넷 어댑터 카드 솔루션이 실시간 분석 데이터베이스에 적합한 예측 가능한 테일 지연 시간을 제공한다고 언급했습니다. 또한 확보된 CPU 코어는 애플리케이션 워크로드에 재할당되어 동일한 물리적 서버에서 전체 테넌트 밀도가 약 24% 증가했습니다.
호환성 및 생태계 통합
배포를 확장할 때 운영 팀은 어댑터가 기존 NVIDIA Spectrum 스위치(무손실 RoCE 프로필) 및 DCBX 구성이 있는 Arista 및 Cisco의 타사 ToR 스위치와 MCX631102AN-ADAT 호환됨을 확인했습니다. 조달 계획을 위해 MCX631102AN-ADAT 데이터시트를 참조하여 전력 봉투(일반적으로 약 12W) 및 열 요구 사항을 검증했습니다. 초기 대량 문의는 MCX631102AN-ADAT 가격이 유사 등급의 SmartNIC에 비해 경쟁력이 있으며 여러 유통업체에서 표준 볼륨 계약에 따라 MCX631102AN-ADAT 판매를 진행하고 있음을 확인했습니다.
요약 및 전망
프로덕션 사례는 MCX631102AN-ADAT이 완전한 100GbE 인프라 개편 없이 TCP 바운드 스토리지 네트워크에서 RDMA 가속 패브릭으로의 근본적인 전환을 가능하게 함을 명확하게 보여줍니다. MCX631102AN-ADAT ConnectX-6 Lx 듀얼 포트 25GbE SFP28 설계를 활용함으로써 조직은 지연 시간에 민감한 워크로드의 유효 처리량을 두 배로 늘리는 동시에 상당한 CPU 리소스를 확보할 수 있습니다. 향후에는 동일한 배포 패턴이 분산 머신 러닝 프레임워크(RoCE를 통한 NCCL) 및 마이크로서비스 기반 상태 저장 애플리케이션으로 확장될 것입니다. 25GbE 업그레이드를 평가하는 아키텍트에게 NVIDIA Mellanox MCX631102AN-ADAT은 고성능, 저지연 데이터 센터 네트워크를 위한 입증되고 프로덕션 강화된 빌딩 블록으로 자리 잡고 있습니다.

