NVIDIA Mellanox 920-9B210-00FN-0D0 en la práctica: Construyendo un tejido NDR de baja latencia para modelos MoE de trillones de parámetros

August 27, 2026

últimas noticias de la compañía sobre NVIDIA Mellanox 920-9B210-00FN-0D0 en la práctica: Construyendo un tejido NDR de baja latencia para modelos MoE de trillones de parámetros

NVIDIA Mellanox 920-9B210-00FN-0D0 en la práctica: Construcción de una red NDR de baja latencia para modelos MoE de billones de parámetros

Antecedentes y el desafío: Cuando el "all-to-all" se convierte en el cuello de botella del entrenamiento

Una importante organización de investigación de IA escaló recientemente su clúster de entrenamiento de modelos de lenguaje grandes de 1.024 a 4.096 GPUs NVIDIA H100, con el ambicioso objetivo de reducir el tiempo de entrenamiento de un modelo MoE (Mixture of Experts) disperso de 1,8 billones de parámetros de meses a menos de dos semanas. Sin embargo, durante la validación inicial, el equipo descubrió que su red HDR existente de 200 Gb/s estaba experimentando una grave congestión durante la fase de comunicación "all-to-all" —un patrón característico de las arquitecturas MoE—, lo que provocó que la utilización de la GPU cayera de un esperado 85% a solo un 52%, muy por debajo del umbral necesario para cumplir su plazo de entrenamiento.

El análisis de la red reveló que la comunicación colectiva "all-to-all" representaba más del 40% de la huella de comunicación del modelo MoE, y a medida que aumentaba el número de expertos, el patrón de tráfico se volvía cada vez más fragmentado y con ráfagas. La red HDR existente, tras activar los mecanismos de control de congestión, experimentó un aumento drástico de la latencia de cola, dejando una parte significativa de las GPUs inactivas y esperando. La organización necesitaba urgentemente una red capaz de ofrecer latencia determinista sub-microsegundo, transporte sin pérdidas y escalabilidad masiva sin bloqueo, y elNVIDIA Mellanox 920-9B210-00FN-0D0 fue diseñado específicamente para este desafío.

Solución y despliegue: Una arquitectura Leaf-Spine NDR optimizada para MoE

La organización desplegó una red Leaf-Spine de dos niveles construida alrededor del920-9B210-00FN-0D0 InfiniBand switch OPN. En cada rack de cómputo, se desplegaron dos switches920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR en la capa leaf, proporcionando conectividad de 400 Gb/s a 64 servidores H100 de doble puerto a través de cables ópticos activos OSFP a OSFP. En la capa spine, 16 switches 920-9B210-00FN-0D0 adicionales interconectaron todos los switches leaf, creando una red fat-tree completamente sin bloqueo con un ancho de banda de bisección agregado de 51,2 Tb/s.

La pieza central de esta solución es la tecnología integrada SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) del switch. Para la carga de trabajo MoE, la comunicación "all-to-all" se descargó directamente en la red del switch, y los switches realizaron la reducción y redistribución de datos dentro de la red. Esto eliminó la necesidad de múltiples pasadas del lado del host, reduciendo drásticamente la sobrecarga de comunicación que había plagado la implementación HDR anterior. La920-9B210-00FN-0D0 datasheet destaca una latencia de corte inferior a 100 ns, que se validó durante la fase de prueba de concepto y resultó fundamental para los estrictos requisitos de latencia de la carga de trabajo MoE.

El920-9B210-00FN-0D0 specifications—incluyendo fuentes de alimentación redundantes y ventiladores intercambiables en caliente—dieron al equipo la confianza para alcanzar su objetivo de disponibilidad del 99,999%. El equipo de ingeniería también confirmó que el ecosistema920-9B210-00FN-0D0 compatible incluía todos los ópticos y cables OSFP que ya habían calificado, eliminando retrasos en la adquisición y simplificando el cronograma de implementación.

Resultados y ganancias medibles: De cuello de botella a facilitador

Después de que la red NDR se desplegó por completo y se reinició el trabajo de entrenamiento MoE, la organización midió mejoras transformadoras en múltiples dimensiones:

  • Recuperación de la utilización de la GPU: La utilización media de la GPU aumentó del 52% al 89%, con una utilización máxima que alcanzó el 94% durante las fases intensivas de cómputo, un resultado directo de la eliminación de las interrupciones inducidas por la red.
  • Reducción de la latencia "all-to-all": El tiempo requerido para un intercambio "all-to-all" completo en 4.096 GPUs se redujo de 180 ms a menos de 45 ms, una mejora del 75% que se tradujo directamente en iteraciones de entrenamiento más rápidas.
  • Tiempo de finalización del trabajo: El cronograma de entrenamiento proyectado para el modelo MoE de 1,8 T se redujo de 14 días a solo 9 días, una aceleración del 36% que redujo significativamente tanto el tiempo de comercialización como los costos de cómputo en la nube.
  • Eficiencia operativa: Con 64 puertos por switch, el número de switches spine requeridos se redujo en un 37% en comparación con un diseño HDR de 40 puertos, simplificando el cableado y reduciendo el consumo de energía por rack en un 28%.

Desde la perspectiva del costo total de propiedad, el equipo financiero de la organización señaló que, si bien el920-9B210-00FN-0D0 price por unidad era más alto que las alternativas HDR, el costo de red por GPU en realidad disminuyó debido a la mayor cardinalidad y al menor número de capas de switches. Esta ventaja económica, combinada con las drásticas mejoras de rendimiento, hizo que la actualización a NDR fuera una clara victoria comercial. La920-9B210-00FN-0D0 InfiniBand switch OPN solution también se integró sin problemas con su implementación existente de NVIDIA UFM, proporcionando visibilidad centralizada y alertas automatizadas que redujeron la sobrecarga operativa en un 40%.

Resumen y perspectivas: La base NDR para cargas de trabajo MoE de próxima generación

ElNVIDIA Mellanox 920-9B210-00FN-0D0 demostró ser la solución transformadora que esta organización de investigación de IA necesitaba para desbloquear todo el potencial de su clúster H100 de 4.096 GPUs. Al ofrecer un ancho de banda NDR de 400 Gb/s, una densidad de 64 puertos y computación en red SHARPv3, el switch les permitió escalar de 1.024 a 4.096 GPUs sin comprometer el rendimiento o la manejabilidad, una hazaña que habría sido imposible con su infraestructura HDR anterior.

Mirando hacia el futuro, la organización planea expandirse a 8.192 GPUs en los próximos 18 meses, aprovechando el920-9B210-00FN-0D0 for sale a través de los socios de canal de NVIDIA para construir una red folded-Clos de tres niveles aún más grande. Para las organizaciones que evalúan sus inversiones en redes de IA y HPC de próxima generación, el 920-9B210-00FN-0D0 ofrece una solución probada y lista para producción que cumple la promesa de optimización de interconexión RDMA de baja latencia a escala exa.