Adaptador de Servidor NVIDIA Mellanox MCX623106AN-CDAT en Acción | Transporte de Baja Latencia RDMA/RoCE y Ganancias de Rendimiento del Servidor
July 22, 2026
NVIDIA Mellanox MCX623106AN-CDAT Adaptador de servidor en acción
Antecedentes y el desafío: Cuando 200GbE cumple con el muro de escala de IA
Una organización de investigación de inteligencia artificial de rápido crecimiento, llamémosla "DeepCore Labs", se enfrentaba a un cuello de botella crítico de escala.que comprende 512 GPU NVIDIA H100 distribuidas en 128 nodosEl problema no era el cálculo o la memoria, sino el tejido de la red.Todos los gradientes de sincronización de reducción estaban tomando más de 15 segundos por iteraciónSu infraestructura existente de 100GbE, basada en TCP/IP basado en software, simplemente no podía manejar el estallido,patrones de comunicación sensibles a la latencia de la formación distribuidaEl equipo necesitaba una solución que pudiera ofrecer una velocidad de línea de 200GbE con una latencia determinista de microsegundos.
Su evaluación les llevó aNVIDIA Mellanox MCX623106AN-CDAT, también conocido como NVIDIA MellanoxEl equipo de investigación reconoció que la tecnología de la inteligencia artificial y HPC es la más adecuada para los trabajos más exigentes.MCX623106AN-CDAT Adaptador ConnectX Tarjeta de red PCIeofreció las capacidades avanzadas de descargas y GPUDirect necesarias para eliminar el cuello de botella de la red y maximizar la utilización de la GPU.
La solución: Despliegue de la tarjeta de adaptador Ethernet MCX623106AN-CDAT
DeepCore Labs desplegó elTarjeta de adaptador Ethernet MCX623106AN-CDATa través de los 128 nodos de capacitación, con cada servidor equipado con un adaptador QSFP112 de doble puerto conectado a un tejido de hoja-espina dorsal construido en conmutadores NVIDIA Spectrum-4.El despliegue aprovechó el soporte nativo de RoCE v2 del adaptador para permitir el transporte Ethernet sin pérdidasLa clave de la solución fue la capacidad GPUDirect RDMA del adaptador,que permitió el movimiento directo de datos entre las GPU a través de la red sin intervención de la CPU una característica crítica para reducir la sincronización de los gastos generales.
El equipo configuró PFC (Control de flujo prioritario) y ECN (Notificación explícita de congestión) en el nivel del interruptor,por la que se dedica la prioridad 3 al tráfico de comunicaciones colectivas y la prioridad 4 al almacenamiento de datos I/OTambién implementaron la tecnología de enrutamiento adaptativo de NVIDIA para distribuir el tráfico dinámicamente a través de múltiples rutas, minimizando los puntos de acceso.Todo el tejido de entrenamiento estaba funcionando con RDMA., con todas las 512 GPU comunicándose sin problemas a través de RoCE.Compatible con MCX623106AN-CDATEl ecosistema demostró ser robusto, las tarjetas se integraron perfectamente con los servidores basados en H100 y NVIDIA NCCL (NVIDIA Collective Communications Library) sin ninguna modificación.
El equipo se refirió a laSe aplicarán las siguientes medidas:ajustar los parámetros de asignación de búfer y control de la congestión,logrando un rendimiento óptimo para su entorno de carga de trabajo mixta, que incluía tanto el entrenamiento sincrónico (dominado por todo lo reducido) como el control asincrónico.
Resultados medibles: eficiencia de escalado, rendimiento y utilización de la GPU
La mejora del rendimiento fue transformadora.NVIDIA Mellanox MCX623106AN-CDAT, también conocido como NVIDIA Mellanox, la latencia de sincronización total se redujo de un promedio de 15,2 segundos a sólo 1,8 segundos por iteración ∙ una mejora de 8,4 veces.El tiempo total de formación para su modelo de parámetro 70B disminuyó de 42 días a 19 días, acelerando su ciclo de investigación en más del 50%.
La utilización de la GPU, que había estado languideciendo en el 62% debido a los retrasos de la red, saltó al 94% después de la actualización, una mejora del 52% en la capacidad de computación efectiva.La avanzada colocación de datos fuera de orden del adaptador y el pacing de paquetes eliminaron las micro-explosiones que habían estado causando picos de latencia de cola, garantizando un rendimiento constante en todos los nodos.
Además del rendimiento de entrenamiento, las ganancias de rendimiento del servidor fueron igualmente convincentes.y aceleración de RoCE reducción de la utilización de la CPU para el procesamiento de la red del 38% a menos del 4% en todos los nodosEsto liberó una capacidad de CPU significativa para el preprocesamiento de datos, compresión de puntos de control y otras tareas auxiliares que anteriormente habían sido restringidas.
| El método métrico | Antes (NIC 100GbE heredado) | Después de (MCX623106AN-CDAT) | Mejora |
|---|---|---|---|
| La latencia de reducción total (por iteración) | 15.2 s | 1.8 s | 8.4 veces más rápido |
| Utilización de la GPU | El 62% | El 94% | 52% más alto |
| Tiempo de formación del modelo (70B parámetros) | 42 días | 19 días | 55% más rápido |
| Gastos generales de la red de la CPU | El 38% | < 4% | 89% más bajo |
| NVMe-oF Lectura de la latencia (almacenamiento) | 185 μs | 12 μs | 15 veces más rápido |
Beneficios operativos: TCO y eficiencia de la infraestructura
Si bien las mejoras en el rendimiento fueron dramáticas, los beneficios operativos y financieros fueron igualmente notables.Solución de tarjeta de adaptador Ethernet MCX623106AN-CDATreducido el costo total de propiedad al eliminar la necesidad de un tejido separado de InfiniBand, ahorrando más de $ 500K en costos de infraestructura de conmutadores.El diseño de eficiencia energética del adaptador (menos de 20W por tarjeta) contribuyó a un ahorro de energía medible en todo el grupo de 128 nodos, reduciendo los gastos anuales de refrigeración en un 18%.
Para los gerentes de TI que evalúan laPrecio MCX623106AN-CDATen contra de las soluciones alternativas, el director de infraestructura de DeepCore señaló que el período de amortización fue inferior a seis meses, impulsado principalmente por la reducción del tiempo de formación,que aceleraron directamente su desarrollo de productosEl equipo también valoró la capacidad del adaptador para el futuro: el mismoMCX623106AN-CDAT para la ventaHoy en día admite 200GbE, pero también es compatible con ópticas 100GbE y 50GbE, lo que proporciona flexibilidad para entornos de velocidad híbrida y actualizaciones graduales.
De acuerdo con elLas especificaciones de MCX623106AN-CDAT, el adaptador incluye funciones de telemetría integrales, incluida la telemetría de red en banda (INT) y el seguimiento de latencia por flujo.,permitiendo la detección proactiva de la micro-congestión antes de que afecte el rendimiento del entrenamiento.manteniendo el comportamiento sin pérdidas incluso durante las operaciones de control que generaron carga adicional de la red.
Resumen y perspectivas: un plan para las redes a escala de IA
El viaje de DeepCore Labs con elNVIDIA Mellanox MCX623106AN-CDAT, también conocido como NVIDIA MellanoxLa tecnología de la inteligencia artificial (IA) es una herramienta que permite a las organizaciones desarrollar o escalar infraestructuras de IA.Tarjeta de adaptador Ethernet MCX623106AN-CDATTransforma la red de un cuello de botella de escalado en un multiplicador de rendimiento.y un 55% de ciclos de formación más rápidos que demuestran la capacidad del adaptador para ofrecer resultados empresariales tangibles en los entornos informáticos más exigentes.
En el futuro, a medida que los tamaños de los modelos continúan duplicándose cada pocos meses y los clústeres de formación distribuidos se expanden a miles de GPU, laMCX623106AN-CDAT Adaptador ConnectX Tarjeta de red PCIePara los arquitectos y líderes de TI que planifican su próxima inversión en infraestructura de IA, este adaptador representa no solo un componente, sino también una herramienta que puede ayudar a mejorar la calidad de la tecnología.Pero un facilitador estratégico para la diferenciación competitivaLos parámetros de ajuste detallados, los guiones de despliegue y los informes de referencia de rendimiento están disponibles en el sitio oficial de la empresa.Se aplicarán las siguientes medidas:¢ una referencia esencial para cualquier despliegue de IA a gran escala.

