NVIDIA Mellanox MQM9790-NS2F en Acción: Construyendo una Fabric RDMA de Baja Latencia para Clústeres de IA y HPC

August 24, 2026

últimas noticias de la compañía sobre NVIDIA Mellanox MQM9790-NS2F en Acción: Construyendo una Fabric RDMA de Baja Latencia para Clústeres de IA y HPC

NVIDIA Mellanox MQM9790-NS2F en acción: Construyendo un tejido RDMA de baja latencia para AI y HPC Clusters

Antecedentes y el desafío: Cuando la expansión se convierte en el cuello de botella

A medida que los grandes modelos de lenguaje se escalan de miles a decenas de miles de GPU, y las simulaciones meteorológicas empujan hacia una resolución a escala de kilómetros,Las limitaciones de los tejidos Ethernet tradicionales se hacen evidentes.En estos entornos, los patrones de comunicación colectiva de MPI, tales como todo-reducir y todo-para-todos, imponen exigencias extremas en la latencia de la red y el control de la congestión.Incluso los nodos de computación más poderosos pasan una parte significativa de sus ciclos esperando datos, lo que efectivamente desperdicia costosos recursos de la GPU.

Es precisamente este el desafío que plantea la Comisión.NVIDIA Mellanox MQM9790-NS2F, también conocido como NVIDIA MellanoxComo un conmutador NDR InfiniBand de 400Gb/s con 64 puertos OSFP, está diseñado para ofrecer una latencia determinista de menos de un microsegundo en miles de puntos finales,permitir una escala lineal verdadera para cargas de trabajo distribuidas.

Solución y implementación: un tejido de hoja espinal construido para RDMA

En un escenario de despliegue típico para un gran laboratorio de investigación de IA, elMQM9790-NS2F Conmutador de banda anchaforma el núcleo de una topología de dos niveles de hoja-espina dorsal. En la capa de hoja, cada rack de cómputo está equipado con una o dos unidades MQM9790-NS2F,proporcionando 64 puertos de conectividad de 400 Gb/s a los servidores de GPU a través de cables de cobre de conexión directa OSFP-OSFP o cables ópticos activosEn la capa de la columna vertebral, los interruptores adicionales MQM9790-NS2F interconectan las hojas, creando un tejido de árbol de grasa no bloqueante con ancho de banda de bisección completo.

What makes this solution particularly compelling is the switch's native support for RDMA over Converged Ethernet (RoCE) when operating in InfiniBand mode—though here it leverages InfiniBand's native RDMA capabilities for even lower latency and CPU offloadEl.MQM9790-NS2F 400Gb/s NDR OSFP de 64 puertosintegra la tecnología SHARPv3 (Protocolo de Agregación y Reducción Jerárquica Escalable) de NVIDIA, que descarga las operaciones colectivas directamente en el tejido del switch.Esto significa que una operación de reducción total que normalmente atravesaría la red varias veces ahora se completa en un solo paso., reduciendo los tiempos de finalización de los trabajos hasta en un 30% para las cargas de trabajo intensivas en comunicación.

Para los arquitectos de red que evalúan laMQM9790-NS2F Solución de conmutador de banda ancha, el proceso de despliegue se agiliza con el Gerente de Telas Unificado (UFM) de NVIDIA.Las capacidades críticas para la gestión de tejidos con más de 2Los primeros usuarios han informado de que elMQM9790-NS2F compatibles con el nuevo sistemaEl sistema, que incluye una amplia gama de cables y transceptores certificados por NVIDIA, simplifica la adquisición y reduce el riesgo de implementación.

Resultados y beneficios medibles: de la teoría a la realidad de la producción

En un reciente despliegue de producción para un clúster de 2.048 GPU dedicado a la formación de modelos de transformadores a gran escala, la actualización de la infraestructura HDR (200Gb/s) a NDR (400Gb/s)NVIDIA Mellanox MQM9790-NS2F, también conocido como NVIDIA MellanoxEn su núcleo, el programa ha producido mejoras medibles en múltiples dimensiones:

  • Reducción del tiempo de finalización del trabajo:Las iteraciones de entrenamiento de extremo a extremo para un modelo de parámetro 175B disminuyeron en un 28%, en gran parte atribuidas a la descarga de SHARPv3 y la reducción de la latencia de cola.
  • Utilización de la red:La utilización promedio del tejido aumentó del 62% al 89% sin desencadenar el colapso de la congestión, gracias a los avanzados mecanismos de enrutamiento adaptativo y control de congestión del interruptor.
  • Simplicidad de funcionamiento:Con 64 puertos por interruptor, el número de interruptores de columna vertebral requeridos se redujo a la mitad en comparación con un diseño HDR de 32 puertos, reduciendo significativamente la complejidad del cableado y el consumo de energía por rack.

De acuerdo con elLas especificaciones MQM9790-NS2F, el switch ofrece una latencia de puerto a puerto inferior a 100 ns y admite hasta 51.2Tb/s de capacidad de conmutación agregada.Los ingenieros de redes también señalaron que elSe aplicará el método de evaluación de la calidad de los productos.reflejará con exactitud el rendimiento del mundo real, sin sorpresas durante la fase de validación.

Desde el punto de vista del TCO, la capacidad de consolidar más puntos finales por nivel de conmutación redujo directamente el gasto de capital.Precio MQM9790-NS2FEn el caso de las soluciones de 200 Gb/s equivalentes, el coste de red por GPU disminuyó debido al mayor radix y al menor número de capas de conmutadores.combinado con las ganancias de rendimiento, hizo el caso de negocio claro para el comité directivo del laboratorio.

Resumen y perspectivas: La Fundación NDR para la Computación Exascale

ElNVIDIA Mellanox MQM9790-NS2F, también conocido como NVIDIA MellanoxLa tecnología de la información es más que una actualización incremental, representa un cambio fundamental en la forma en que se diseñan los clústeres de HPC y IA.y aceleración de cómputo en red en un único factor de forma de 1U, permite a los arquitectos construir tejidos que se escalan a decenas de miles de puntos finales sin sacrificar el rendimiento o la manejabilidad.

En el futuro, a medida que las cargas de trabajo continúan exigiendo un mayor ancho de banda y una menor latencia, laMQM9790-NS2F Conmutador de banda anchaservirá de base para la próxima generación de sistemas exascales.Su compatibilidad con las plataformas existentes de NVIDIA Quantum-2 y la integración perfecta con UFM aseguran un camino de migración suave para las organizaciones que actualizan de tejidos HDRPara los gerentes de TI y arquitectos que evalúan sus inversiones en redes de próxima generación, el MQM9790-NS2F ofrece una solución comprobada,Solución lista para la producción que cumple con la promesa de la optimización de la interconexión RDMA de baja latencia.