NVIDIA Mellanox MCX631432AN-ADAB en Acción: Transporte de baja latencia RDMA/RoCE y optimización del rendimiento del servidor
July 28, 2026
NVIDIA Mellanox MCX631432AN-ADAB en acción: RDMA / RoCE transporte de baja latencia y optimización del rendimiento del servidor
Antecedentes y retos: el cuello de botella de la red en un grupo de formación de IA
Una empresa fintech líder recientemente implementó un clúster de IA basado en GPU de 64 nodos diseñado para la capacitación de estrategia de comercio de alta frecuencia, con cada servidor equipado con almacenamiento NVMe de alto rendimiento.,En la actualidad, el volumen de formación real se ha reducido significativamente por debajo de las expectativas.El análisis posterior al despliegue reveló que el tejido de comunicación entre nodos basado en TCP/IP de 10GbE se había convertido en el cuello de botella principal.Las operaciones de comunicación colectiva All-Reduce mostraron una latencia de hasta 4 ̊5 milisegundos.Mientras que el gasto de CPU para el procesamiento de protocolos de red excedió el 40% El equipo necesitaba urgentemente una solución de red que pudiera reducir drásticamente la latencia de la comunicación y recuperar la capacidad de computación de la CPU.
Solución y implementación: Construir una red sin pérdidas RoCE con el MCX631432AN-ADAB
Después de una evaluación técnica exhaustiva, el equipo seleccionó elNVIDIA Mellanox MCX631432AN-ADAB, también conocido como NVIDIACada servidor estaba equipado con unMCX631432AN-ADAB ConnectX-6 Lx con doble puerto 25GbE SFP28Adaptador, con ambos puertos SFP28 conectados a conmutadores redundantes NVIDIA Spectrum-3 para establecer una arquitectura altamente disponible.
El despliegue se ejecutó en tres fases distintas:
- Fase 1 Proyecto piloto (8 nodos):El equipo instaló elTarjeta de adaptador Ethernet MCX631432AN-ADABen un subconjunto de servidores GPU, configurando RoCEv2 con Control de flujo prioritario (PFC) y Notificación de congestión explícita (ECN) para crear un tejido Ethernet sin pérdidas.NCCL (NVIDIA Collective Communications Library) fue recompilado con soporte RDMA.
- Fase 2 - Ajuste y validación:Utilizando los datos de telemetría detallados en elSe aplicarán las siguientes medidas:, el equipo ajustó los parámetros de DCB y los umbrales de búfer para eliminar las tormentas de pausa PFC manteniendo una pérdida de paquetes cercana a cero.Las especificaciones de MCX631432AN-ADABEl objetivo de este estudio es orientar la optimización de la moderación de interrupciones y las profundidades de cola para el perfil de carga de trabajo específico.
- Fase 3 Despliegue completo de la producción (64 nodos):Después de la validación exitosa, los nodos restantes fueron migrados al nuevo adaptador.Compatible con el MCX631432AN-ADABcontroladores integrados a la perfección con el entorno existente basado en Ubuntu y la pila Mellanox OFED.
El equipo observó que elSolución de tarjeta de adaptador Ethernet MCX631432AN-ADABproporcionaron una ruta de migración sencilla, ya que los adaptadores eran totalmente compatibles con su infraestructura existente de cableado y interruptores SFP28, eliminando la necesidad de costosas actualizaciones auxiliares.
Resultados y beneficios: transformación medible en latencia y rendimiento
Las mejoras de rendimiento obtenidas a través de laNVIDIA Mellanox MCX631432AN-ADAB, también conocido como NVIDIALa siguiente tabla resume las métricas clave antes y después de la actualización:
| El método métrico | Pre-actualización (10GbE TCP/IP) | Se aplicarán las siguientes medidas: | Mejora |
|---|---|---|---|
| La latencia de reducción total (promedio) | 4.7 ms | 0.32 ms | 14.7 veces la reducción |
| Utilización de la CPU de la red (por nodo) | El 42% | 9% | 33 pp liberado |
| Utilización de la GPU (fase de carga de datos) | El 61% | El 89% | +28% |
| Producción de formación en grupos | 1.8x la línea de base | 4.3x la línea de base | 2.4 veces el aumento |
Más allá de estas ganancias cuantitativas, el equipo observó mejoras operativas que impactaron directamente en la productividad de los desarrolladores.Las carreras de entrenamiento modelo que antes requirieron 36 horas se completaron en solo 15 horasLa descarga NVMe-oF basada en hardware también redujo la latencia de acceso al almacenamiento en un 35%, acelerando aún más las operaciones de puntos de control intensivos en datos.Para las organizaciones que evalúan el caso de negocio, elMCX631432AN-ADAB precioEl equipo también señaló que el procesamiento de datos de los servidores de GPU es muy competitivo en comparación con la ganancia de rendimiento de 2.4x y la capacidad de posponer las adquisiciones de servidores de GPU adicionales.MCX631432AN-ADAB para la ventaLos paquetes con switches NVIDIA Spectrum ofrecieron el camino más rentable para la futura escalabilidad.
Resumen y perspectivas: Una base para la innovación de la carga de trabajo futura
Este despliegue de la producción demuestra que elNVIDIA Mellanox MCX631432AN-ADAB, también conocido como NVIDIAes mucho más que una actualización de red rutinaria es un elemento de infraestructura transformadora que desbloquea todo el potencial de la computación moderna acelerada por GPU.La combinación de ancho de banda agregado de 50 Gb/s, latencia de comunicación colectiva de menos de 0,4 ms, y capacidades de descarga de CPU dramáticas posicionan este adaptador como una opción ideal para organizaciones que ejecutan IA distribuida, HPC,y cargas de trabajo de análisis en tiempo real.
En el futuro, el equipo de fintech está explorando la integración con NVIDIA DOCA para acelerar aún más la programabilidad de la ruta de datos e implementar el aprovisionamiento de contacto cero para futuras expansiones de clústeres.También están evaluando las capacidades de telemetría del adaptadorSe aplicarán las siguientes medidas:El objetivo de este proyecto es desarrollar modelos predictivos de gestión de la congestión.Solución de tarjeta de adaptador Ethernet MCX631432AN-ADABsigue demostrando su valor, la empresa planea estandarizar en esta plataforma para todas las futuras inversiones en infraestructura,Confiado en que proporciona una base sólida y escalable para la próxima generación de aplicaciones financieras basadas en IA.

