Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 Conmutador InfiniBand en la práctica

July 15, 2026

últimas noticias de la compañía sobre Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 Conmutador InfiniBand en la práctica

Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand Switch en la práctica. Optimización de interconexión de baja latencia para grupos RDMA / HPC / AI

Antecedentes y desafíos: Cuando la escala de los grupos se encuentra con cuellos de botella de interconexión

La división de investigación de IA de una compañía líder de Internet se encontró en una encrucijada familiar.Su creciente flota de servidores de GPU, que abarcaban múltiples racks y se utilizaban cada vez más para la formación de modelos de lenguaje grandes, sufría de tiempos de finalización de trabajos impredecibles.El tejido existente basado en Ethernet, aunque adecuado para cargas de trabajo de uso general, no podía manejar los patrones de tráfico sincronizados y aglomerados de la formación distribuida.Todas las operaciones de reducción se detendrían regularmente debido a las caídas de paquetes y la congestión incastEl equipo de infraestructura necesitaba un cambio fundamental en la forma en que su red de back-end manejaba el tráfico RDMA.y lo necesitaban sin revisar toda su arquitectura de centro de datos.

Diseño de la solución: Despliegue del 920-9B210-00FN-0D0 InfiniBand Switch OPN

Después de evaluar múltiples opciones de interconexión, el equipo seleccionó elMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 (incluido el juego)La implementación se centró en torno a una topología de hoja-espina dorsal de dos niveles, con cada interruptor de hoja conectando hasta 40 nodos de GPU a través de enlaces de 400Gb / s.920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDRLa variante fue elegida específicamente por su arquitectura no bloqueadora y sus capacidades de computación integradas en la red SHARPv3.Esto permitió al equipo descargar las operaciones de comunicación colectiva directamente en el tejido del interruptor, lo que reduce la sobrecarga de la CPU y libera ciclos de GPU para el cálculo real.

En términos de despliegue físico, los interruptores se instalaron con flujo de aire de adelante hacia atrás para que coincidieran con la configuración existente de pasillo caliente/pasillo frío.Si el vehículo no está equipado con un dispositivo de seguridad, el vehículo deberá ser equipado con un dispositivo de seguridad.El cableado se mantuvo consistente utilizando transceptores QSFP-DD, con el920-9B210-00FN-0D0 compatibles con el sistema operativoLas líneas ópticas validadas en todo el presupuesto de enlace, incluidas las conexiones de columna vertebral a hoja que abarcan hasta 100 metros.

Enfoque de despliegue: integración paso a paso

  • Fase 1 Validación en laboratorio:Se utilizó un banco de pruebas a pequeña escala con 8 nodos GPU y dos switches para comparar la latencia y el rendimiento.NVIDIA Mellanox 920-9B210-00FN-0D0 también está disponible en vivo.demostró una latencia de conmutación inferior a 600ns, una mejora del 60% con respecto a la generación anterior de HDR.
  • Fase 2  Despliegue por etapas:El equipo migró un módulo de entrenamiento a la vez, utilizando el Administrador de Telas Unificado de NVIDIA para monitorear las métricas de salud y congestión del enlace en tiempo real.Esto minimizó la interrupción de las cargas de trabajo de producción en curso.
  • Fase 3: Integración a gran escala:Los 18 switches se desplegaron en tres racks, formando una columna vertebral totalmente no bloqueante con enlaces ascendentes de 400Gb / s.El enrutamiento adaptativo permitió equilibrar dinámicamente el tráfico y evitar la sobre suscripción durante los picos de envío de trabajos.

A lo largo del despliegue, el equipo de ingenieros se refirió a laLas especificaciones 920-9B210-00FN-0D0La telemetría avanzada del interruptor proporcionó una visibilidad granular de los recuentos de errores por puerto y la utilización del enlace,permitir el mantenimiento proactivo y la planificación de la capacidad.

Resultados medibles y beneficios operativos

Dentro de dos semanas del despliegue a gran escala, las mejoras fueron tangibles.que representa una reducción del 37% en los gastos generales de comunicaciónLos tiempos de finalización del trabajo para un modelo típico de estilo GPT mejoraron en casi un 30%, lo que permitió al equipo de investigación iterar más rápido y ejecutar más experimentos por semana.El motor SHARPv3 incorporado descargó un promedio del 18% de las operaciones colectivas, lo que se traduce directamente en una mayor utilización de la GPU y un menor consumo de energía por carrera de entrenamiento.

En el ámbito operativo, el equipo de TI informó menos fallos de trabajo relacionados con la red y significativamente menos tiempo dedicado al diagnóstico de problemas a nivel de enlace.920-9B210-00FN-0D0 Solución OPN de conmutador de banda anchaLa interfaz de gestión unificada redujo la curva de aprendizaje para el equipo de operaciones de red,que ahora podría gestionar toda la tela a través de un solo panel de vidrio.

Consideraciones sobre costes y adquisiciones

Mientras que la inicial920-9B210-00FN-0D0 precioEn el caso de los equipos de procesamiento de datos, el análisis del costo total de propiedad dijo una historia diferente.La organización logró una reducción del 22% en los costos de la instancia en la nube para una capacidad de cómputo equivalentePor otra parte, el920-9B210-00FN-0D0 para la ventaLa inversión se basó en el apoyo de NVIDIA Mellanox a largo plazo, lo que permitió la puja competitiva a través de múltiples socios de canal.

Resumen y perspectivas: un plan para la infraestructura de IA de próxima generación

El despliegue delMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 (incluido el juego)La combinación de velocidades NDR de 400 Gb/s, que permite a las empresas de la industria de la información y la comunicación utilizar la tecnología de la información y la comunicación para desarrollar sus propias tecnologías de la información.latencia submicrosegundosEn la actualidad, los arquitectos de redes apreciarán la flexibilidad de los sistemas de procesamiento de datos basados en RDMA.920-9B210-00FN-0D0 InfiniBand conmutador OPNEn la actualidad, la mayoría de los sistemas de gestión informática están integrados en diversas topologías, mientras que los gerentes de TI pueden confiar en las robustas herramientas de gestión y en unaSi el vehículo no está equipado con un dispositivo de seguridad, el vehículo deberá ser equipado con un dispositivo de seguridad.para la planificación de la capacidad.

Mirando hacia el futuro, la organización ya está planeando expandir el tejido para apoyar a los grupos de GPU más grandes,incluida la integración de las DPU BlueField-3 para descarga de almacenamiento adicional y aislamiento de seguridadEl.920-9B210-00FN-0D0 compatibles con el sistema operativoEl ecosistema garantiza que las futuras actualizaciones, ya sean a NICs o tecnologías ópticas más recientes, se apoyarán sin problemas.Este cambio representa no sólo una mejora incremental sino un habilitador fundamental de rendimiento a escala.