NVIDIA Mellanox MCX4121A-ACAT 서버 어댑터 기술 백서
July 22, 2026
NVIDIA Mellanox MCX4121A-ACAT 서버 어댑터 기술 백서
1프로젝트 배경 및 요구사항 분석
현대 데이터 센터는 점점 더 까다로운 작업 부하를 지원하기 위해 끊임없는 압력을 받고 있습니다. AI/ML 교육과 고주파 거래에서 분산 데이터베이스 및 NVMe-over-Fabrics 스토리지까지.25GbE 이더넷이 주류 액세스 계층 표준이 되었지만, 많은 조직은 원시 대역폭만으로 응용 프로그램 성능에 번역되지 않습니다. 근본적인 병목은 전통적인 TCP/IP 스택에 있습니다: 높은 CPU 중단 오버헤드,예측할 수 없는 지연시간, 그리고 서버 CPU 코어의 20~30%를 소비할 수 있는 비효율적인 패킷 처리. 지연 민감하고 처리량 굶주린 애플리케이션의 경우, 네트워크 서브시스템은 종종 가장 약한 링크가 된다.
이 백서는NVIDIA 멜라노크스 MCX4121A-ACAT25GbE 인프라의 모든 잠재력을 발휘하려는 기업을 위해 설계된MCX4121A-ACAT 이더넷 어댑터 카드이 솔루션은 컨버지드 이더넷 (RoCE) 상에서 하드웨어 가속 RDMA와 듀얼 포트 25GbE 연결을 결합합니다. 솔루션은 세 가지 주요 목표를 목표로합니다. (1) 애플리케이션 수준의 대기 시간을 10μs 미만으로 줄이는 것,(2) CPU 네트워크 처리 오버헤드를 80% 이상 줄이는 것, 그리고 (3) 건축 재작업 없이 몇 개의 노드에서 수백 개의 노드까지 원활한 확장성을 가능하게 합니다.
2전체 네트워크 및 시스템 아키텍처 설계
권장된 아키텍처는 25GbE가 서버 액세스 계층이며 100GbE가 척추로 업링크되는 잎 척추 토폴로지를 채택합니다. 설계의 중심에는MCX4121A-ACAT ConnectX-4 Lx 듀얼 포트 25GbE SFP28모든 컴퓨팅 및 스토리지 노드에서 배포되는 어댑터입니다.
- 손실 없는 이더넷 패브릭:RoCE v2를 PFC (위선 흐름 제어) 와 ECN (명확한 혼잡 알림) 로 활용하여 패킷 드롭을 제거하고 결정적 대기 시간을 보장합니다.
- 하드웨어가 어디서나 오프로드:체크섬, 세그먼테이션, RDMA를 포함한 트랜스포트 계층 처리 (transport-layer processing) 를 어댑터에 오프로드하여 비즈니스 애플리케이션에 대한 CPU 사이클을 자유롭게 합니다.
- 활동적-활동적 부과:연결 집계 (LACP) 모드에서 두 SFP28 포트를 모두 활용하여 50Gb/s 집계 대역폭과 자동 패일오버를 제공합니다.
해결책은 완전히MCX4121A-ACAT 호환성선도적인 서버 플랫폼 (델 파워 에지, HPE 프로 리안트, 수퍼마이크로) 및 NVIDIA 스펙트럼 및 아리스타의 스위치와 함께 스토리지에 대한 아키텍처는 RoCE를 통해 NVMe-oF를 지원합니다.로컬 NVMe 드라이브에 접근하는 지연 시간으로 공유된 디저그레이트 스토리지를 가능하게 합니다..
3NVIDIA Mellanox MCX4121A-ACAT의 역할 및 주요 기능
이 솔루션의 기본 요소로,NVIDIA 멜라노크스 MCX4121A-ACAT세 가지 중요한 기능을 합니다.
| 기능 | 시행 세부 사항 | 사업 이득 |
|---|---|---|
| RDMA/RoCE 엔진 | 하드웨어 기반 RoCE v2 ECN/PFC 지원, 1μs 이하의 대기 | 데이터 이동에 대한 거의 0의 CPU 참여 |
| 듀얼 포트 25GbE | 두 개의 독립적인 SFP28 포트, 50Gb/s 총 처리량 | 액티브-액티브 결합 또는 액티브-스탠드바이 부하 |
| 가상화 및 오버레이 오프로드 | 포트당 최대 128 VF까지 SR-IOV; VXLAN/NVGRE 오프로드 | 고밀도 다중임대업과 연대율 성능 |
주요 사양MCX4121A-ACAT 데이터 시트PCIe 3.0 x8 호스트 인터페이스, 포괄적인 오프로드 (체크섬, LSO/LRO, VLAN 스트리핑/입기) 및 포트별 고급 텔레메트리어댑터의 전력 효율성 (< 10W 전형) 및 광범위한 운영 체제 지원 (리눅스), 윈도우, VMware ESXi) 는 이질적인 환경을 위한 다재다능한 빌딩 블록이 됩니다.
4배포 및 확장 권고
그린 필드 배포를 위해 우리는 25GbE 액세스 및 100GbE/400GbE 스핀 업링크와 함께 두 계층의 잎 척추 토폴로지를 권장합니다. 각 서버는 하나의MCX4121A-ACAT 이더넷 어댑터 카드두 포트가 분리된 잎 스위치에 연결되어 리던스를 보장합니다. RoCE 조직은 모든 스위치에서 일관된 QoS 구성이 필요합니다.우선순위 3의 PFC와 동일한 교통급의 ECN 표시우리는 모니터링과 문제 해결을 단순화하기 위해 RoCE 트래픽에 전용 VLAN을 할당하는 것을 권장합니다.
브라운필드 환경의 경우MCX4121A-ACAT 이더넷 어댑터 카드 솔루션어댑터가 10GbE SFP+ 광학과 후향 호환되기 때문에 기존 케이블은 25GbE로 단계적으로 업그레이드하는 동안 재사용 할 수 있습니다.어댑터는 또한 필수 RoCE 활성화 없이 표준 이더넷 스위칭을 지원, 팀들이 먼저 하드웨어를 배포하고 팩처가 성숙함에 따라 단계적으로 RDMA 기능을 활성화 할 수 있습니다.
솔루션을 확장하는 것은 간단합니다: 추가 노드는 단순히 동일한MCX4121A-ACAT 판매SKU, 그리고 조직은 자동으로 LLDP와 DCBx 협상을 통해 새로운 엔드포인트를 수용합니다.전용 RoCE 혼잡 관리 컨트롤러를 배치하는 것이 좋습니다 (e예를 들어, NVIDIA 스펙트럼 스위치와 내장된 텔레메트리) 를 사용하여 손실없는 행동을 유지합니다.
5. 운영, 모니터링, 문제 해결 및 최적화
RoCE 조직의 효과적인 작동은 다층 모니터링 전략을 필요로합니다.
- 어댑터 레벨 텔레메트리의MCX4121A-ACAT 사양PFC 프레임, ECN로 표시된 패킷 및 떨어지는 프레임에 대한 포트 카운터를 포함합니다.
mlx5cmd또는 NVIDIA 펌웨어 툴로 프로메테우스/그라파나에 이 제품을 내보낼 수 있습니다. - 스위치 레벨 모니터링:버퍼 점유율, 중지 프레임 수, 그리고 척추 및 잎 스위치에 있는 대기열 깊이를 모니터링 합니다. 일시 프레임의 갑작스러운 증가는 ECN 임계 조정이 필요할 수 있는 마이크로 혼잡을 나타냅니다.
- 애플리케이션 레벨 메트릭:RDMA 애플리케이션의 경우, 공급자 제공 라이브러리를 사용하여 WR (Work Request) 완료 지연 및 CQ (Completion Queue) 오버플로우 이벤트를 추적합니다.
일반적인 문제 해결 시나리오는 다음과 같습니다.
- RoCE 성능 저하:PFC가 모든 스위치 포트에서 활성화되어 있고 DSCP 표시가 스위치 구성과 일치하는지 확인합니다.MCX4121A-ACAT 데이터 시트버퍼 할당 설정을 검증하기 위해
- 링크 플래핑 또는 CRC 오류:SFP28 케이블 품질을 확인하고 어댑터 펌웨어가 최신 버전으로 업데이트되었는지 확인하십시오.
- CPU는 여전히 높은 상태입니다.RDMA가 실제로 사용되고 있는지 확인합니다 (TCP로 돌아가지 않습니다) 드라이버 카운터와 응용 프로그램 로그를 검사하여.
최적화를 위해, 우리는 다음과 같은 조정 매개 변수를 추천합니다 (장대한 실험실 검증에서 유래): - Set interrupt coalescing (moderation) to 4 µs for mixed workloads - Enable hardware timestamping for precise latency measurement - Configure RSS (Receive Side Scaling) across multiple CPU cores for non-RDMA traffic - For storage workloads, 최대 RDMA MTU를 4096 바이트로 늘려 프로토콜 오버헤드를 줄이세요
6요약 & 가치 평가
의NVIDIA 멜라노크스 MCX4121A-ACAT이 솔루션은 현대 데이터 센터에 변혁적 가치를 제공합니다. TCP/IP를 RDMA/RoCE로 대체함으로써 조직은 애플리케이션 수준에서 5~10배의 지연 시간을 줄일 수 있습니다.CPU 네트워크 오버헤드를 80% 이상 줄입니다., 서버 컨테이너 밀도를 30%~50% 증가합니다.MCX4121A-ACAT 이더넷 어댑터 카드25GbE 도입에 대한 비용 효율적인 경로를 제공하며 후향 호환성 및 미래 준비된 릴로드 기능을 통해 투자 보호를 제공합니다.
전체 소유비용을 평가할 때,MCX4121A-ACAT 가격상당한 운영 절감으로 상쇄됩니다: 서버 수 감소 (더 많은 사용량으로 인해), 낮은 냉각 비용 (<10W 전력 소모 덕분에),그리고 별도의 InfiniBand 또는 독점적인 직물의 제거해결책은 완전히MCX4121A-ACAT 호환성쿠버네티스, 아파치 스파크, 텐서플로우 등 주요 오픈소스 생태계와 함께 기업 및 클라우드 네이티브 배포를 통해 광범위한 적용을 보장합니다.
자세한 배포 스크립트, 구성 템플릿 및 성능 벤치마크 보고서를 참조하십시오.MCX4121A-ACAT 데이터 시트이 백서는 시작점으로 작용합니다. 아키텍처가 검증되고 구성 요소가 생산 준비가되어 있으며 혜택이 측정됩니다.MCX4121A-ACAT ConnectX-4 Lx 듀얼 포트 25GbE SFP28단순히 어댑터일 뿐 아니라 RDMA를 위한 미래 데이터 센터의 전략적 지원자입니다.

