Documento técnico de NVIDIA Mellanox MCX623106AN-CDAT Server Adapter

July 24, 2026

Documento técnico de NVIDIA Mellanox MCX623106AN-CDAT Server Adapter

NVIDIA Mellanox MCX623106AN-CDAT Adaptador de servidor Libro blanco técnico

1Antecedentes del proyecto y análisis de los requisitos

Los centros de datos modernos están experimentando un cambio de paradigma impulsado por el crecimiento explosivo de la inteligencia artificial, el aprendizaje automático a gran escala y el análisis en tiempo real.Estas cargas de trabajo requieren un rendimiento de red sin precedentes, no sólo ancho de banda en brutoLos adaptadores Ethernet tradicionales, que dependen de las pilas TCP/IP basadas en software, son muy sencillos, pero tienen una latencia determinista de menos de 5 μs, un movimiento de datos eficiente de la CPU y una escalabilidad perfecta a miles de nodos.se han convertido en un cuello de botella crítico, que consume hasta el 40% de los núcleos de la CPU a velocidades de 200GbE e introduce variaciones de latencia impredecibles que degradan el rendimiento de las aplicaciones.Para las organizaciones que construyen clústeres de IA a gran escala (más de 500 GPU) o infraestructura de nube de hiperescala, esta ineficiencia se traduce directamente en tiempos de formación más largos, mayores costes de infraestructura y un tiempo de comercialización más lento.

Este libro blanco presenta una solución técnica integral centrada en laNVIDIA Mellanox MCX623106AN-CDAT, también conocido como NVIDIA MellanoxEl sistema está diseñado para empresas que buscan maximizar sus inversiones en 200GbE.Tarjeta de adaptador Ethernet MCX623106AN-CDATOfrece RDMA acelerado por hardware a través de Ethernet convergente (RoCE), lo que permite un transporte sin pérdidas y con latencia ultrabaja que transforma la E/S de la red de un cuello de botella de escala en una ventaja competitiva.La solución está diseñada específicamente para cumplir tres objetivos fundamentales: (1) lograr una latencia de aplicación de extremo a extremo de menos de 5 μs para las comunicaciones colectivas de IA, (2) reducir la sobrecarga de procesamiento de la red de la CPU a menos del 5% y (3) proporcionar una solución escalable,fundamento a prueba de futuro para 200GbE y más allá.

2Diseño general de la arquitectura de red y sistema

La arquitectura recomendada adopta una topología de hoja-columna vertebral de alto rendimiento con 200GbE como capa de acceso al servidor y 400GbE/800GbE enlaces ascendentes a la columna vertebral.MCX623106AN-CDAT Adaptador ConnectX Tarjeta de red PCIeLa arquitectura está construida en torno a seis principios clave:

  • Tejido Ethernet sin pérdidas:Aprovechando RoCE v2 con PFC (Control de flujo prioritario) y ECN (Notificación explícita de congestión) en todos los switches para eliminar las caídas de paquetes y garantizar la latencia determinista para el tráfico RDMA.
  • GPUDirect RDMA:Permite la comunicación directa de GPU a GPU a través de la red sin la participación de la CPU, reduciendo la latencia y liberando recursos de la CPU para tareas de cómputo.
  • Descarga de hardware en todas partes:Descargar el transporte, la seguridad (IPsec / MACsec) y los protocolos de almacenamiento al adaptador, liberando ciclos de CPU para la lógica de la aplicación.
  • Redundancia activa-activa:Utilizando los dos puertos QSFP112 en modo de agregación de enlaces (LACP) para un ancho de banda agregado de 400 Gb/s y un cambio automático de fallo con recuperación de subsegundo.
  • Ingeniería de tráfico inteligente:Enrutamiento adaptativo y entrega de paquetes fuera de orden para evitar puntos de acceso de congestión y maximizar la utilización de la tela.
  • Telemetría completa:Telemetría de la red en banda (INT) y seguimiento por flujo para la detección proactiva de la congestión y la planificación de la capacidad.

La solución es totalmenteCompatible con MCX623106AN-CDATPara almacenamiento, la arquitectura admite NVMe-oF sobre RoCE con latencia de menos de 15 μs,permitir el almacenamiento compartido desglosado para grupos de formación a gran escala.

3El papel y las características clave del NVIDIA Mellanox MCX623106AN-CDAT

Como componente fundamental de esta solución, elNVIDIA Mellanox MCX623106AN-CDAT, también conocido como NVIDIA Mellanoxcumple cuatro funciones críticas dentro de la arquitectura:

Función Detalle de la aplicación Beneficio para el negocio
El motor RDMA/RoCE RoCE v2 basado en hardware con ECN/PFC, latencia inferior a 0,6 μs, soporte GPUDirect Casi cero participación de la CPU; 8 veces más rápido todo-reducir para el entrenamiento de IA
Dos puertos 200GbE Dos puertos QSFP112 independientes, de capacidad agregada de 400 Gb/s Enlace activo-activo para ancho de banda; en espera activa para redundancia
Interfaz PCIe 5.0 PCIe 5.0 x16 (hasta 32 GT/s) con motor DMA avanzado Elimina el cuello de botella de la interfaz de host para el tráfico de 200GbE
Virtualización y superposición de carga Se aplicará el método de ensayo de la velocidad de carga de la red de carga de la red de carga. Alquiler múltiple de alta densidad con seguridad y rendimiento de la tasa de línea

Las principales especificaciones técnicas extraídas de laSe aplicarán las siguientes medidas:incluir capacidades completas de descarga (suma de comprobación, LSO/LRO, eliminación/inserción de VLAN, RSS con hasta 128 colas), algoritmos avanzados de control de congestión,y soporte completo para las bibliotecas de comunicaciones colectivas de NVIDIA (NCCL)El.Las especificaciones de MCX623106AN-CDATTambién destacar el apoyo a la compatibilidad 100GbE y 50GbE, ofreciendo flexibilidad de despliegue para entornos de velocidad mixta.

4Recomendaciones para el despliegue y la ampliación

Para los grupos de IA de campo verde, recomendamos una topología de hoja-espina dorsal de dos niveles con acceso 200GbE y enlaces ascendentes de espina dorsal 800GbE.Tarjeta de adaptador Ethernet MCX623106AN-CDATcon ambos puertos QSFP112 conectados a interruptores de hoja separados para la redundancia.PFC sobre la prioridad 3 (para el tráfico colectivo RDMA) y la prioridad 4 (para el almacenamiento)Recomendamos dedicar VLANs separadas para RDMA, gestión, almacenamiento y tráfico de arrendatarios para simplificar el monitoreo y la resolución de problemas.

Para los entornos de campo negro con infraestructura 100GbE existente, elSolución de tarjeta de adaptador Ethernet MCX623106AN-CDATDebido a que el adaptador es compatible con opticas 100GbE QSFP56, el cableado existente puede reutilizarse durante la actualización gradual a 200GbE.El adaptador también admite conmutación Ethernet estándar sin habilitación obligatoria de RoCE, lo que permite a los equipos implementar primero el hardware y activar las capacidades RDMA en etapas a medida que la tela madura y las cargas de trabajo justifican la transición.

La escala de la solución más allá de 500 nodos requiere consideraciones adicionales.Recomendamos implementar una estrategia de gestión de congestión RoCE dedicada utilizando switches NVIDIA Spectrum-4 con telemetría incorporada y ajuste dinámico del umbral ECNPara los grupos que superen los 1.000 nodos, considere implementar un controlador de gestión de tejido centralizado (por ejemplo, NVIDIA NetQ) para mantener la visibilidad de extremo a extremo y la consistencia de la configuración automatizada.MCX623106AN-CDAT para la ventaEl servicio de seguridad de NVIDIA incluye una garantía completa y soporte de actualización de firmware, lo que garantiza una fiabilidad a largo plazo a escala.

5. Operaciones, monitoreo, solución de problemas y optimización

El funcionamiento efectivo del tejido RoCE requiere una estrategia de monitoreo y solución de problemas de múltiples capas:

  • Telemetría a nivel de adaptador:ElLas especificaciones de MCX623106AN-CDATincluyen contadores por puerto para marcos PFC, paquetes marcados con ECN, marcos eliminados, errores de enlace y épocas de congestión.¿Qué quieres decir?,el étool, o herramientas de firmware de NVIDIA para exportar estas métricas a los paneles de mando Prometheus / Grafana con alertas apropiadas.
  • Telemetría de red en banda (INT):Aprovechar el soporte INT del adaptador para rastrear las latencias por flujo y las profundidades de cola en todo el tejido, lo que permite la identificación precisa de las fuentes de micro-congestión.
  • Monitoreo a nivel de interruptor:Supervisa la ocupación del búfer, el recuento de fotogramas de pausa, la profundidad de la cola y las tasas de marcado de ECN en los interruptores de columna vertebral y hoja.Los aumentos repentinos de los marcos de pausa indican micro-congestión que puede requerir ajuste del umbral de ECN.
  • Métricas a nivel de aplicación:Para las aplicaciones RDMA, realiza un seguimiento de las latencias de finalización de WR (Work Request), los eventos de desbordamiento de CQ (Completion Queue) y los recuentos de errores de QP (Queue Pair) utilizando las bibliotecas NVIDIA libibverbs y rdma-core.

Escenarios comunes de solución de problemas y acciones recomendadas:

  • Deterioro del rendimiento de RoCE:Verifique que el PFC esté habilitado en todos los puertos del switch y que la marcación DSCP coincida con la configuración del switch.Se aplicarán las siguientes medidas:para validar los ajustes de asignación de búfer con respecto a los valores recomendados para su perfil de carga de trabajo.
  • Erros en el desplazamiento del enlace o en el CRC:Verifique la calidad del cable QSFP112 (asegure el cumplimiento de las especificaciones 200G AOC o DAC) y verifique que el firmware del adaptador esté actualizado a la última versión.
  • Problemas de rendimiento de GPU Direct:Confirmar que GPUDirect está correctamente inicializado y que la topología PCIe admite DMA de igual a igual sin conmutación intermedia.
  • Estancamiento de PFC o tormenta de pausa:Compruebe si las prioridades están mal configuradas y asegúrese de que el PFC esté habilitado solo en las clases de tráfico RoCE (no en el tráfico de gestión o almacenamiento).

Para la optimización, recomendamos los siguientes parámetros de ajuste basados en una amplia validación de laboratorio:

  • Interrupción de la unión (moderación):Ajuste a 2 ‰ 4 μs para las cargas de trabajo de entrenamiento de IA para minimizar la latencia y mantener la eficiencia de la CPU.
  • RDMA MTU:Aumentar a 4096 bytes para todas las comunicaciones reducidas para reducir los gastos generales del protocolo y mejorar el rendimiento.
  • RSS (escalado del lado de recepción):Configurar en múltiples núcleos de CPU para el tráfico no RDMA para distribuir el procesamiento y evitar la saturación de un solo núcleo.
  • Los límites de las ECN:Establecer un umbral mínimo del 40% del búfer y un umbral máximo del 75% para el tráfico de prioridad 3, ajustándose en función de los patrones de congestión observados y de las características de la carga de trabajo.

6Resumen y evaluación del valor

ElNVIDIA Mellanox MCX623106AN-CDAT, también conocido como NVIDIA MellanoxLa solución ofrece un valor transformador para los centros de datos modernos a escala de IA. Al reemplazar el TCP/IP basado en software por RDMA/RoCE y GPUDirect acelerados por hardware,Las organizaciones pueden lograr reducciones de latencia a nivel de aplicación de 8 ¢ 10xLa reducción de los gastos generales de la red de CPU en más del 85% y el aumento de la utilización de la GPU de menos del 70% a más del 95%.Tarjeta de adaptador Ethernet MCX623106AN-CDATProporciona un camino rentable hacia la adopción de 200GbE con protección de la inversión mediante compatibilidad con versiones anteriores de 100GbE y capacidades de descarga preparadas para el futuro para cargas de trabajo emergentes.

Al evaluar el coste total de propiedad, elPrecio MCX623106AN-CDATse compensa con importantes ahorros operativos: tiempo de formación reducido (aceleración del tiempo de comercialización), menor número de servidores (debido a una mayor utilización de la GPU),reducción de los costes de refrigeración (gracias a un consumo de energía < 20 W), y la eliminación de tejidos separados de InfiniBand.Compatible con MCX623106AN-CDATcon las principales pilas de software de IA y HPC, incluidas las bibliotecas NVIDIA NCCL, PyTorch, TensorFlow y MPI, lo que garantiza una amplia aplicabilidad en las implementaciones empresariales, en la nube y en la investigación.

Para los scripts de implementación detallados, plantillas de configuración e informes de benchmark de rendimiento, consulte el manual oficialSe aplicarán las siguientes medidas:Este libro blanco sirve como una base para que la arquitectura sea validada, los componentes estén listos para la producción,y los beneficios son mediblesEl.MCX623106AN-CDAT Adaptador ConnectX Tarjeta de red PCIeno es simplemente un adaptador; es un habilitador estratégico para el centro de datos del futuro listo para la IA, con latencia ultra baja.