NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch en acción: Optimización de la interconexión de baja latencia para grupos RDMA / HPC / AI
August 21, 2026
NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch en acción: Optimización de la interconexión de baja latencia para grupos RDMA / HPC / AI
En el ámbito de la capacitación de modelos de IA a gran escala y la computación de alto rendimiento (HPC), la latencia de la red a menudo se convierte en el cuello de botella crítico que limita la escalabilidad y la eficiencia del clúster.Un centro de supercomputación a nivel nacional ha completado recientemente una importante mejora de infraestructura, la transición de un tejido EDR InfiniBand de 100Gb/s a una solución HDR de 200Gb/s construida en torno alNVIDIA Mellanox MQM8790-HS2F, también conocido como NVIDIAEste estudio de caso examina los desafíos a los que se enfrentaron, la estrategia de implementación y las ganancias de rendimiento mensurables logradas a través de esta interconexión de próxima generación.
Antecedentes y desafíos: cuando la latencia se convierte en el techo de rendimiento
El centro de supercomputación opera un clúster heterogéneo compuesto por más de 2.000 nodos de GPU, que soporta una variada combinación de cargas de trabajo que incluye simulación climática, investigación genómica,y la formación de grandes modelos lingüísticosCon la red EDR de 100 Gb/s anterior,El equipo de operaciones observó que las operaciones de comunicación colectiva, tales como "all-reduce" y "all-gather", estaban consumiendo una proporción cada vez mayor del tiempo total de ejecución de los trabajos a medida que crecía el número de nodos.En algunos trabajos de formación distribuida, los gastos generales relacionados con la red representaron casi el 40% del tiempo de ejecución de extremo a extremo, limitando gravemente la utilización de la GPU y extendiendo los ciclos de convergencia de modelos.
Entre los desafíos adicionales se incluyen:
- Puntos críticos de congestión:Los patrones de tráfico en la capacitación de IA a menudo son estallidos e impredecibles, lo que lleva a bloqueos en la cabeza de la línea y picos de latencia en la cola que interrumpen la programación del trabajo.
- Aceleración insuficiente en la red:El tejido heredado carecía de soporte para capacidades de descarga colectiva avanzadas, lo que obligaba a todas las operaciones de reducción a atravesar la jerarquía de CPU y memoria del host.
- Complejidad de la gestión:La resolución de problemas de rendimiento requería un análisis manual de múltiples herramientas de monitoreo, lo que dificulta la identificación de las causas raíces en las implementaciones a gran escala.
Después de evaluar múltiples opciones de interconexión, el centro seleccionó elSe aplicará a los vehículos de las categorías M1 y M2.La nueva estructura de la Unión Europea es la base de su nuevo tejido.Se aplicarán las siguientes medidas:, este switch ofrece 40 puertos de rendimiento HDR sin bloqueo de 200Gb/s, latencia de corte por debajo de 130ns y soporte para SHARP v3.0 capacidades colectivas de descarga que abordaron directamente sus principales puntos débiles.
Solución y implementación: Construir un tejido de baja latencia para IA/HPC
El despliegue adoptó una topología de árbol de grasa de dos niveles, con 24MQM8790-HS2F 200Gb/s HDR 40 puertos QSFP56En la configuración anterior se incluían dos interruptores, los cuales se desplegaban como nodos de hoja y 8 unidades como interruptores de columna vertebral.1 subscripción excesiva en todo el grupo, suficiente para su carga de trabajo actual, al tiempo que permite un margen de maniobra para la expansión futura.
| Capa de despliegue | Número de interruptores | Puertos utilizados | Conectividad |
|---|---|---|---|
| Hoja (por estante) | 24 | 32 puertos cada uno | Servidores ToR + enlaces ascendentes de la columna vertebral |
| Espinilla | 8 | 36 puertos cada uno | La malla completa para todos los interruptores de hojas |
Cada interruptor de hoja se conecta a los nodos de cómputo a través de los adaptadores de canales host HDR NVIDIA ConnectX-6.MQM8790-HS2F compatibles con el sistema de seguridadLa instalación física completa se completó en dos semanas, y el equipo de ingenieros de la industria de la tecnología de la información, la óptica y el ecosistema de cableado permitieron al equipo reutilizar los cables QSFP56 existentes, acelerando el despliegue y reduciendo los costes de adquisición.con el plano de control aprovechando el Administrador de Telas Unificadas (UFM) de NVIDIA para el descubrimiento y el aprovisionamiento automatizados de topología.
El soporte del interruptor para el enrutamiento adaptativo y el control de congestión resultó crítico para manejar la característica de tráfico explosivo de las cargas de trabajo de IA.Al redistribuir dinámicamente los flujos entre las rutas disponibles, elMQM8790-HS2F Conmutador de banda anchaSe ha reducido al mínimo la formación de puntos críticos y se ha mantenido un rendimiento constante incluso durante los períodos de mayor actividad.
Resultados y ganancias: Mejoras mensurables en el rendimiento del trabajo y la utilización de la GPU
Después de tres meses de operación de producción, el centro de supercomputación informó ganancias significativas de rendimiento en múltiples dimensiones:
- Reducción de la latencia:La latencia media de ping-pong MPI disminuyó de 680 ns en el tejido EDR anterior a menos de 130 ns con elNVIDIA Mellanox MQM8790-HS2F, también conocido como NVIDIA, lo que representa una mejora de 5 veces en la eficiencia del intercambio de mensajes.
- Aceleración de la operación colectiva:La latencia de reducción total para trabajos de 1024 nodos disminuyó en un 62%, gracias a la descarga SHARP v3.0 que realiza operaciones de reducción directamente dentro del tejido del interruptor.
- Utilización de la GPU:El efecto combinado de una menor latencia y un mayor ancho de banda impulsó la utilización promedio de la GPU del 72% al 91%, lo que se traduce en una reducción del 26% en el tiempo de solución para las grandes ejecuciones de entrenamiento de modelos de lenguaje.
- Eficiencia de la programación de los trabajos:La reducción de la variación de latencia de cola permitió al programador SLURM empaquetar más trabajos en el mismo conjunto de nodos sin interferencias en el rendimiento, aumentando el rendimiento general del clúster en aproximadamente un 18%.
Cuando el equipo más tarde comparó elPrecio MQM8790-HS2Fcontra interruptores alternativos de otros proveedores, they found that the total cost per Gb/s delivered was highly competitive—especially when factoring in the reduced management overhead and the switch's ability to support both HDR and HDR100 link speeds, protegiendo las inversiones en entornos de velocidad mixta.
Desde una perspectiva operativa, la plataforma UFM integrada proporcionó un solo panel de vidrio para monitorear la salud del tejido, los patrones de tráfico y los errores a nivel de enlace.Esta visibilidad permitió al equipo identificar proactivamente los cables degradantes y reemplazarlos durante el mantenimiento programado, evitando los tiempos de inactividad no planificados.
Resumen y perspectivas: un modelo para la próxima generación de tejidos de baja latencia
Este estudio de caso demuestra que elMQM8790-HS2F Solución de conmutador de banda anchaes más que una simple actualización de velocidad, es un componente transformador para las organizaciones que buscan liberar todo el potencial de rendimiento de su infraestructura de IA y HPC.Combinando la alta densidad de puertos, latencia ultra baja y capacidades de computación en red, el switch aborda directamente los cuellos de botella de la comunicación que históricamente han limitado la escalabilidad del clúster.
Mirando hacia el futuro, el centro de supercomputación planea expandir su estructura a 2.400 nodos en el próximo año fiscal, aprovechando la mismaSe aplicará a los vehículos de las categorías M1 y M2.El equipo también está explorando el soporte del switch para los algoritmos de reducción mejorados de SHARP v3.0,que prometen acelerar aún más las cargas de trabajo emergentes como las redes neuronales gráficas y el aprendizaje de refuerzo.
Para los gerentes de TI, arquitectos de red e ingenieros que evalúan las opciones de interconexión para sus propias compilaciones de clústeres, elNVIDIA Mellanox MQM8790-HS2F, también conocido como NVIDIAOfrece un camino comprobado y validado en el campo para lograr latencia de menos de un microsegundo, maximización de la utilización de la GPU y gestión simplificada del tejido.Las especificaciones MQM8790-HS2FLos diseños de referencia están disponibles en el portal de documentación técnica de NVIDIA, y el interruptor está ahora ampliamente disponible.MQM8790-HS2F para la ventapara localizar un socio regional.

