Conmutador InfiniBand Mellanox (NVIDIA Mellanox) MQM9790-NS2F en acción: optimización de interconexión de baja latencia para RDMA/HPC
July 13, 2026
Mellanox (NVIDIA Mellanox) MQM9790-NS2F InfiniBand Switch en Acción ¢ Optimización de interconexión de baja latencia para racimos RDMA / HPC / AI
A medida que los clústeres de capacitación de IA aumentan de miles a decenas de miles de GPU, la latencia de la red y el control de congestión se convierten en los factores decisivos en la utilización efectiva del cómputo.Una de las principales organizaciones mundiales de investigación en IA ha desplegado recientemente elMellanox (NVIDIA Mellanox) MQM9790-NS2F, también conocido como MellanoxEl nuevo sistema de supercomputación de la nueva generación, que soporta modelos de lenguaje a gran escala, simulaciones de dinámica molecular y aprendizaje profundo distribuido.Este artículo examina el despliegue en el mundo real, detallando cómo este conmutador InfiniBand transforma el transporte RDMA, la comunicación HPC y los tejidos de entrenamiento paralelo de datos de IA.
Antecedentes y desafíos: desde el compromiso Ethernet hasta el imperativo de interconexión sin pérdidas
La organización inicialmente se basó en un tejido Ethernet de 100GbE con RoCEv2. Sin embargo, a medida que sus nodos de GPU crecieron a más de 1,200 servidores (cada uno con GPUs 8× NVIDIA H100), el número de nodos de GPU aumentó.se encontraron con bloqueos persistentes de PFC, sintonización compleja de ECN, y caídas ocasionales de paquetes que causaron cortes de entrenamiento.Estos problemas prolongaron los tiempos de finalización promedio de los trabajos en más del 35% y consumieron un considerable esfuerzo de ingeniería en la resolución de problemas de la redLa infraestructura existente ya no podía ofrecer la latencia determinista a nivel de microsegundos y el rendimiento libre de congestión requeridos para operaciones masivas de reducción total y de todos a todos.
Solución y despliegue:MQM9790-NS2F Interruptor de banda anchacomo la columna vertebral de la tela
Después de evaluar múltiples alternativas, el equipo seleccionó elNVIDIA Mellanox MQM9790-NS2F, también conocido como NVIDIA MellanoxLa estructura de los portahojas de hojas es el núcleo de una nueva arquitectura de dos niveles.MQM9790-NS2F 400Gb/s NDR OSFP de 64 puertoslos switches, que proporcionan 64 puertos OSFP por unidad y una capacidad de conmutación total de 25,6 Tb/s. La velocidad NDR de 400 Gb/s por puerto, combinada con conmutación de corte y enrutamiento adaptativo,permite una latencia de puerto a puerto inferior a 600 ns, un requisito crítico para sus cargas de trabajo intensivas en GPUEl despliegue aprovechó elMQM9790-NS2F Solución de conmutador de banda anchaintegrado con el firmware NVIDIA Quantum‐2, lo que garantiza una fluidezMQM9790-NS2F compatibles con el nuevo sistemafuncionamiento con adaptadores ConnectX‐7 y DPU BlueField‐3 existentes.
Las opciones clave de despliegue incluyen:
- Topología:No bloquear el árbol de grasa con transceptores ópticos OSFP de 64 puertos a 400G, lo que permite un ancho de banda de bisección completa para todos los nodos de GPU.
- Dirección:NVIDIA UFM (Unified Fabric Manager) para telemetría en tiempo real, detección de congestión y reencaminamiento proactivo de rutas.
- Descarga colectiva:SHARPv3 permitió acelerar las operaciones de reducción total, descargando la comunicación de las CPU anfitrionas.
Para garantizar una transición sin problemas, el equipo consultó a losSe aplicará el método de evaluación de la calidad de los productos.yLas especificaciones MQM9790-NS2FEl factor de forma 1U y las fuentes de alimentación redundantes encajan perfectamente en su densidad de rack existente, y los puertos OSFP admiten cables DAC y módulos ópticos,ofreciendo flexibilidad para la expansión futura.
Resultados y beneficios medidos ganancias cuantificables en el rendimiento y la eficiencia
Después de la implementación y optimización completas, la organización documentó mejoras significativas en múltiples dimensiones:
| El método métrico | Antes (RoCEv2) | Después de (MQM9790-NS2F) |
|---|---|---|
| La velocidad media de latencia de reducción total (1 GB) | - 18 μs | < 8 μs |
| La latencia de la cola (99,9 por ciento de la llena) | > 150 μs | < 15 μs |
| Utilización efectiva de la GPU | - El 72% | ~ 91% |
| Tiempo de finalización del trabajo (promedio) | Línea de base | -28% (1.4 veces más rápido) |
Además de los números en bruto, el equipo informó de interrupciones cercanas a cero relacionadas con la congestión, lo que simplificaba en gran medida las operaciones de la red.NVIDIA Mellanox MQM9790-NS2F, también conocido como NVIDIA MellanoxAdemás, el sistema permite el balanceo automático de carga en todos los 64 puertos OSFP, eliminando el ajuste manual de ECN.MQM9790-NS2F Conmutador de banda anchaproporcionaron un rendimiento determinista incluso bajo un 95% de utilización del enlace, una hazaña imposible con su configuración Ethernet anterior.
La organización también señaló que elPrecio MQM9790-NS2F, cuando se amortizó durante el ciclo de vida de 5 años, se compensó por un menor consumo de energía por puerto (≈1,5 W por puerto 400G) y menores costos de cableado debido a una mayor densidad de puertos.Con disponibilidad general ahora madura, han confirmado queMQM9790-NS2F para la ventaEn el caso de los contratos públicos, el procedimiento de contratación se ha simplificado a través de los canales autorizados, y laSe aplicará el método de evaluación de la calidad de los productos.proporcionaron todos los detalles necesarios de la instalación y de cumplimiento.
Resumen y Perspectivas Un proyecto para las infraestructuras de IA de próxima generación
La adopción de laMellanox (NVIDIA Mellanox) MQM9790-NS2F, también conocido como Mellanoxen este clúster HPC/IA a gran escala demuestra que un tejido InfiniBand construido específicamente ya no es un lujo sino una necesidad para las organizaciones que empujan los límites de la IA y la computación científica.Al ofrecer una latencia constante de menos de un microsegundo, el transporte RDMA sin pérdidas, y la aceleración de la computación en red, laMQM9790-NS2F 400Gb/s NDR OSFP de 64 puertosSwitch permite a los centros de datos alcanzar una escalabilidad casi lineal de hasta decenas de miles de GPU.
En el futuro, el equipo planea ampliar el tejido conMQM9790-NS2F Conmutador de banda anchaLas unidades de apoyo a las próximas cargas de trabajo de clase exascale, incluidos el modelado climático y la genómica.MQM9790-NS2F compatibles con el nuevo sistemaPara los arquitectos y gerentes de TI que evalúan actualizaciones similares, este caso del mundo real confirma que laMQM9790-NS2F Solución de conmutador de banda anchaofrece un camino comprobado y rentable hacia redes de clusters de alto rendimiento y baja latencia un factor fundamental para la próxima década de innovación en IA.

