NVIDIA Mellanox MCX653105A-HDAT en Acción: Transporte de baja latencia RDMA/RoCE y optimización del rendimiento del servidor
July 29, 2026
NVIDIA Mellanox MCX653105A-HDAT en acción: RDMA / RoCE transporte de baja latencia y optimización del rendimiento del servidor
Antecedentes y retos: el cuello de botella de la red en un clúster AI/HPC
Una gran empresa tecnológica recientemente implementó un clúster acelerado por GPU de 128 nodos para la formación de modelos de lenguaje grande (LLM),con cada nodo equipado con ocho GPU NVIDIA H100 y almacenamiento NVMe de alto rendimientoSin embargo, al escalar más allá de los 32 nodos, el grupo experimentó una dramática degradación del rendimiento.mientras que la pila de red TCP/IP consumió más del 45% de los recursos de la CPU por nodoLa red construida sobre múltiples enlaces 25GbE se había convertido en el cuello de botella principal, limitando gravemente la utilización de la GPU y extendiendo los ciclos de formación mucho más allá de los plazos aceptables.El equipo necesitaba urgentemente una solución capaz de ofrecer latencia ultra baja y ancho de banda masivo mientras descarga el procesamiento de red intensivo en CPU.
Solución y implementación: Transformación del tejido con el MCX653105A-HDAT
Después de una exhaustiva evaluación técnica, el equipo seleccionó elNVIDIA Mellanox MCX653105A-HDAT, también conocido como NVIDIACada nodo de la GPU estaba equipado con unMCX653105A-HDAT Adaptador ConnectX tarjeta de red PCIe, configurado con conectividad 100GbE de doble puerto para proporcionar 200 Gb/s de ancho de banda agregado por servidor.
El despliegue se realizó en cuatro fases estructuradas:
- Fase 1: Instalación de hardware (128 nodos):Cada servidor recibió elTarjeta de adaptador Ethernet MCX653105A-HDATLos adaptadores se instalaron con el último firmware y la pila de controladores NVIDIA OFED.
- Fase 2 Configuración RoCEv2:El equipo habilitó RoCEv2 en todo el tejido, ajustando cuidadosamente los parámetros de Control de Flujo de Prioridad (PFC) y Notificación de Congestión Explicita (ECN) para establecer un entorno Ethernet sin pérdidas.Las características avanzadas de gestión de la congestión se detallan en elSi el vehículo no está equipado con un dispositivo de control de velocidad, se aplicará el procedimiento siguiente:Las inversiones en el mercado de valores de mercado de los Estados miembros han sido fundamentales para lograr una asignación óptima del colchón.
- Fase 3: Optimización de la NCCL:La Biblioteca de Comunicaciones Colectivas de NVIDIA (NCCL) fue reconfigurada para aprovechar las capacidades RDMA del adaptador,con reglas de dirección de tráfico personalizadas programadas en los motores de procesamiento integrados del adaptador para optimizar los patrones específicos de reducción total y acumulación total de la carga de trabajo LLM.
- Fase 4: Validación y ajuste:Utilizando los datos de telemetría expuestos a través delLas especificaciones MCX653105A-HDAT, el equipo validó la configuración, ajustó los ajustes de moderación de interrupción y estableció métricas de rendimiento de referencia para el monitoreo continuo.
En particular, el adaptador resultó serCompatible con MCX653105A-HDATcon la infraestructura de cableado existente, ya que los puertos QSFP28 soportaban ópticas de 100GbE y 25GbE, lo que permite una migración elegante sin reemplazo de cable perturbador.El equipo también aprovechó las capacidades de multi-host del adaptador para soportar funciones de computación y almacenamiento en el mismo puerto físico.
Resultados y beneficios: mejoras medibles en el rendimiento de la formación
Las mejoras de rendimiento obtenidas por elNVIDIA Mellanox MCX653105A-HDAT, también conocido como NVIDIALas principales métricas de rendimiento antes y después de la actualización se resumen a continuación:
| El método métrico | Pre-actualización (25GbE TCP/IP) | El valor de las emisiones de CO2 de los motores de combustión renovable se calculará en función de la temperatura de la atmósfera y de la temperatura de la atmósfera. | Mejora |
|---|---|---|---|
| La latencia total de reducción (128 nodos) | 9.2 ms | 0.28 ms | 32.8 veces la reducción |
| Utilización de la CPU de la red (por nodo) | El 47% | El 6% | 41 pp recuperados |
| Utilización de la GPU (fase de entrenamiento) | El 58% | El 94% | +36% de aumento |
| Producción de formación en grupos | 1.9x la línea de base | 5.7x la línea de base | Aumento de 3 veces |
Más allá de estos logros cuantitativos, el equipo observó beneficios operacionales significativos: las carreras de entrenamiento que antes consumieron 12 días se completaron en solo 4 días.acelerando drásticamente los ciclos de iteración del modeloLa ruta de datos programable del adaptador permitió la configuración de tráfico personalizada para los flujos prioritarios, asegurando que el tráfico crítico de comunicación colectiva nunca experimentara contención.Para las organizaciones que evalúan el retorno de la inversión, elPrecio de MCX653105A-HDATEl equipo señaló que el aumento de rendimiento de 3x y la capacidad de aplazar las adquisiciones de servidores GPU adicionales por al menos 12 meses.MCX653105A-HDAT para la ventaLos paquetes con switches NVIDIA Spectrum-4 ofrecieron la economía más favorable para el despliegue completo de clústeres.
Resumen y perspectivas: Una fundación para la infraestructura de IA de próxima generación
Este despliegue a escala de producción valida que elNVIDIA Mellanox MCX653105A-HDAT, también conocido como NVIDIAes un componente transformador para los modernos clústeres de IA y HPC. La combinación de ancho de banda agregado de 200 Gb/s, latencia de comunicación colectiva de menos de 0,3 milisegundos,y descargas integrales de hardware permite a las organizaciones lograr una escalabilidad casi lineal para cargas de trabajo aceleradas por GPUComo un punto a puntoSolución de tarjeta de adaptador Ethernet MCX653105A-HDAT, elimina el cuello de botella de la red que ha limitado históricamente la eficiencia de la formación distribuida.
En el futuro, la empresa está explorando la integración con NVIDIA DOCA para implementar una programabilidad adicional de la ruta de datos para la optimización específica de la carga de trabajo.Además, están aprovechando la telemetría avanzada del adaptador, ampliamente documentada en elSi el vehículo no está equipado con un dispositivo de control de velocidad, se aplicará el procedimiento siguiente:¢ crear modelos de rendimiento predictivos y estrategias automatizadas de mitigación de la congestión.NVIDIA Mellanox MCX653105A-HDAT, también conocido como NVIDIAse ha convertido en la piedra angular de su hoja de ruta de infraestructura de IA, proporcionando una base sólida y escalable para la próxima generación de desarrollo y implementación de modelos de fundación.

