NVIDIA Mellanox MCX623106AN-CDAT 서버 어댑터 기술 솔루션
June 10, 2026
이 기술 백서는 네트워크 아키텍트, 사전 판매 엔지니어 및 운영 팀에게NVIDIA 멜라녹스 MCX623106AN-CDAT우리는 현대 데이터 센터 환경에서 RDMA/RoCE를 사용하여 결정적인 낮은 지연을 달성하고 서버 처리량을 극대화하는 방법을 다루고 있습니다.
1프로젝트 배경 및 요구사항 분석
전통적인 TCP/IP 스택은 중요한 오버헤드 (overhead) 를 도입합니다.인공지능 교육 클러스터다음 세대의 인프라에 대한 주요 요구 사항은 다음과 같습니다.
- 저장 및 실시간 분석을 위한 10μs 이하의 끝에서 끝까지의 지연
- 비즈니스 로직을 위해 CPU를 무료 코어로 우회 (목적: <20% 네트워크 관련 CPU 사용)
- 100GbE 잎 척추 토폴로지에서 PFC와 ECN를 지원하는 손실 없는 이더넷 천재
- 성능 저하 없이 인라인 암호화 (IPsec/TLS)
- 기존 자동화 프레임워크 (Ansible, Terraform) 와의 원활한 통합
2전체 네트워크 및 시스템 아키텍처
참조 아키텍처는 전체에 100GbE 포트를 가진 2단계 잎 척추 토폴로지를 채택합니다. 각 컴퓨팅 / 스토리지 노드에는MCX623106AN-CDAT ConnectX 어댑터 PCIe 네트워크 카드주요 설계 요소:
- 리프 스위치: 4MB 공유 버퍼, PFC 우선 순위 3 (저장) 및 4 (AI 트래픽) 로 구성되어 있으며, 200KB 대기선 깊이에서 ECN 표시 문턱
- 척추 스위치: 차단하지 않는 12.8Tbps 천재, 3: 1 과잉 구독 비율 (동-서 패턴에 최적화)
- 호스트 구성: PCIe 4.0 x16 (또는 사용 가능한 경우 PCIe 5.0), 256MB 단속기 메모리
- RDMA 전송: DCQCN 혼잡 제어와 함께 RoCEv2, 4K MTU, 256 바이트까지 인라인 데이터
의MCX623106AN-CDAT 이더넷 어댑터 카드 솔루션최대 1,024개의 가상 기능 (VF) 과 256개의 물리적 기능 (PF) 을 지원하여 NFV 및 컨테이너화 작업 부하에 이상적입니다.
3. NVIDIA Mellanox MCX623106AN-CDAT의 역할 및 주요 기능
의NVIDIA 멜라녹스 MCX623106AN-CDAT데이터 플레인 엔진으로 작용하여 호스트 CPU에서 모든 네트워크 처리를 처리합니다.MCX623106AN-CDAT 데이터 시트그리고 공식MCX623106AN-CDAT 사양, 중요한 능력은 다음을 포함합니다:
| 특징 | RDMA/RoCE에 대한 혜택 |
|---|---|
| 하드웨어 스티어링 (ASAP2) | 특정 대기열에 직접 패킷을 보내기 |
| 칩 내 RoCE 혼잡 관리 | 펌웨어에서 구현된 DCQCN 100ns 응답 곡성성 |
| GPUDirect® RDMA | 호스트 메모리를 우회하는 GPU 메모리 액세스 2μs 지연 감소 |
| VirtIO 가속 | VM/컨테이너 네트워킹에 대한 네이티브 성능 |
의MCX623106AN-CDAT 이더넷 어댑터 카드또한 보안 부팅과 플래시 암호화를 포함하고 있으며 금융 및 정부 부문의 엄격한 보안 정책을 충족합니다.
4배포 및 확장 권고
브라운 필드 배포를 위해, 어댑터는 완전히MCX623106AN-CDAT 호환펌웨어 업그레이드 후 기존 100GbE 스위치 (브로드컴, 멜라녹스, 시스코) 와 함께. 권장 배포 단계:
- 1단계 (실험실 검증):두 개의 저장 노드 + 두 개의 컴퓨팅 노드, 포트당 PFC와 ECN를 활성화, ib_write_bw로 검증 (포트당 98Gb/s의 처리량 목표)
- 2단계 (실험):한 개의 전체 랙 (40 노드), ECN 임계값으로 DCQCN를 배포합니다: min=150KB, max=500KB
- 3단계 (스케일 아웃):척추층이 있는 멀티 랙, 글로벌 PFC 중지 프레임을 모니터링 (총 트래픽의 <0.1% 유지)
확장용으로, 어댑터는 NVIDIA 스펙트럼 스위치와 함께 사용할 때 링크 집계 (LAG) 및 적응 라우팅 (AR) 을 지원합니다.혼합 속도 환경 (100GbE ~ 25GbE) 에서 출구 포트에 버퍼 예약이 필요합니다..
5운영, 모니터링 및 문제 해결
NVIDIA DOCA 프레임워크는 포괄적인 텔레메트리를 제공합니다. 필수 모니터링 메트릭은 다음과 같습니다.
- 큐 카운터:rdma_out_of_sequence, cnp_sent, cnp_received (ethtool -S를 통해)
- PCIe 건강:수정할 수 있는/조정할 수 없는 오류, 링크 속도 협상 (mlxlink 도구)
- 혼잡 감지:PFC 감시기, ECN 표시 패킷 비율 (목적 <5%)
일반적인 문제 해결: RoCE 성능이 80Gb/s 이하로 떨어지면 PCIe 양분화를 확인 (x16이어야 한다), TSO/GRO를 비활성화하고 스위치 ECN 임계값을 확인합니다.MCX623106AN-CDAT 가격, 솔루션은 일반적으로 서버 수를 통합함으로써 9~12개월 이내에 ROI를 달성합니다.
6요약 & 가치 평가
의NVIDIA 멜라녹스 MCX623106AN-CDAT이 솔루션 가이드는 소프트웨어 기반 네트워킹에 비해 최대 75%까지 CPU 오버헤드를 줄이는 동시에 결정적이고 낮은 지연 시간 구조를 제공합니다. 이 솔루션 가이드는 자세한 아키텍처 설계, 주요 기능,배포 단계, 그리고 운영적 최선 사례.MCX623106AN-CDAT 판매평가 단위에 대한 허가 된 유통업체에 연락 할 수 있습니다.MCX623106AN-CDAT 데이터 시트그리고 상세한MCX623106AN-CDAT 사양요청이 있을 때 사용할 수 있습니다.

