NVIDIA Mellanox 920-9B210-00FN-0D0 en la práctica: Construyendo una red NDR de baja latencia para clústeres de IA de billones de parámetros
August 26, 2026
NVIDIA Mellanox 920-9B210-00FN-0D0 en la práctica: Construyendo un tejido NDR de baja latencia para grupos de IA de trillones de parámetros
Antecedentes y el desafío: Cuando HDR cumple con modelos de billones de parámetros
Una organización líder de investigación de IA recientemente amplió su gran grupo de capacitación de modelos de lenguaje de 1.024 a 4.096 GPUs NVIDIA H100, con el objetivo de comprimir la línea de tiempo de capacitación para un 1.8 billones de parámetros modelo de MoE (Mixture of Experts) de meses a menos de dos semanasSin embargo, durante la validación inicial, el equipo observó una congestión severa en la fase de comunicación de todos a todos en su tejido HDR de 200Gb/s existente,La utilización de la GPU se desploma del 85% esperado a tan sólo el 52%, muy por debajo del umbral requerido para cumplir con su ambicioso plazo de formación..
El análisis de la red reveló que las operaciones colectivas de todo a todos, que son intrínsecas a las arquitecturas del Ministerio de Energía,Los datos de las conexiones HDR estaban saturando los enlaces HDR y activando mecanismos de control de congestión que amplificaron aún más la latencia.La organización necesitaba un tejido que pudiera ofrecer determinismo,latencia de submicrosegundos a través de miles de puntos finales al tiempo que proporciona el espacio de banda ancha para absorber ráfagas de tráfico sin colapso de rendimientoEste es precisamente el reto queNVIDIA Mellanox 920-9B210-00FN-0D0 también está disponible en vivo.La Comisión ha decidido
Solución y implementación: un tejido NDR de 400Gb / s para IA exascale
La organización desplegó el920-9B210-00FN-0D0 InfiniBand conmutador OPNEn la capa de hojas, cada estante recibió dos piezas de tejido de dos capas.920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDRconmutadores, que proporcionan 128 puertos de conectividad de 400 Gb/s a 64 servidores H100 de doble puerto por rack a través de cables ópticos activos OSFP-OSFP.16 interruptores 920-9B210-00FN-0D0 adicionales interconectados todos los interruptores de hoja, creando un árbol de grasa sin bloqueo con un ancho de banda de bisección completa de 51,2 Tb/s por nivel de columna vertebral.
Lo que hizo que esta solución fuera particularmente atractiva fue la tecnología SHARPv3 (Protocolo de Agregación y Reducción Jerárquica Escalable) integrada en el switch.La comunicación de todos a todos se descargó directamente en el tejido del interruptor., con los switches que realizan la reducción y redistribución de datos en la red.Reducción drástica de los gastos generales de comunicación que habían afectado al despliegue anterior de HDR.
De acuerdo con elSi el vehículo no está equipado con un dispositivo de seguridad, el vehículo deberá ser equipado con un dispositivo de seguridad.El equipo de ingenieros también confirmó que el interruptor ofrece una latencia de corte inferior a 100ns, que fue validada durante la fase de prueba de concepto.920-9B210-00FN-0D0 compatibles con el sistema operativoEl sistema incluyó todas las ópticas y cables OSFP que ya habían calificado, eliminando los retrasos en la adquisición.Las especificaciones 920-9B210-00FN-0D0incluyendo fuentes de alimentación redundantes y ventiladores intercambiables en caliente le dio al equipo la confianza necesaria para alcanzar su objetivo de disponibilidad del 99,999% para el grupo de producción.
Resultados y beneficios medibles: de cuello de botella a facilitador
Después de desplegar el tejido completo de NDR y reiniciar el trabajo de capacitación del Ministerio de Energía, la organización midió mejoras transformadoras en múltiples dimensiones:
- Recuperación de la utilización de la GPU:La utilización media de la GPU aumentó del 52% al 89%, con una utilización máxima del 94% durante las fases de computación intensiva, un resultado directo de la eliminación de los bloqueos inducidos por la red.
- Reducción de la latencia de todo a todo:El tiempo requerido para un intercambio completo de todo a todo a través de 4.096 GPUs disminuyó de 180 ms a menos de 45 ms, una mejora del 75% que se tradujo directamente en iteraciones de entrenamiento más rápidas.
- Tiempo de finalización del trabajo:El calendario de formación proyectado para el modelo 1.8T MoE se redujo de 14 días a solo 9 días, una aceleración del 36% que redujo significativamente tanto el tiempo de comercialización como los costos de computación en la nube.
- Eficiencia operativa:Con 64 puertos por interruptor, el número de interruptores de columna vertebral requeridos se redujo en un 37% en comparación con un diseño HDR de 40 puertos, simplificando el cableado y reduciendo el consumo de energía por rack en un 28%.
Desde la perspectiva del coste total de propiedad, el equipo de finanzas de la organización señaló que, si bien el920-9B210-00FN-0D0 precioEl coste de red por GPU disminuyó debido al mayor radix y al menor número de capas de conmutación.Combinado con las ganancias de rendimiento dramáticas, hizo de la actualización de la NDR una clara victoria comercial.920-9B210-00FN-0D0 Solución OPN de conmutador de banda anchaTambién se integró a la perfección con su implementación existente de NVIDIA UFM, proporcionando visibilidad centralizada y alertas automatizadas que redujeron los gastos generales operativos en un 40%.
Resumen y perspectivas: La Fundación NDR para la IA de próxima generación
ElNVIDIA Mellanox 920-9B210-00FN-0D0 también está disponible en vivo.demostró ser la solución transformadora que esta organización de investigación de IA necesitaba para liberar todo el potencial de su cluster H100 de 4.096-GPU.y la computación en red SHARPv3, el cambio les permitió escalar de 1.024 a 4.096 GPU sin comprometer el rendimiento o la capacidad de gestión, una hazaña que habría sido imposible con su infraestructura HDR anterior.
Mirando hacia el futuro, la organización planea expandirse a 8.192 GPUs en los próximos 18 meses, aprovechando el920-9B210-00FN-0D0 para la ventaPara las organizaciones que evalúan sus inversiones en redes de IA y HPC de próxima generación,El 920-9B210-00FN-0D0 ofrece una, una solución lista para la producción que cumple con la promesa de la optimización de la interconexión RDMA de baja latencia a exascala.

