NVIDIA Mellanox 920-9B210-00FN-0D0 Referencia técnica: 400Gb/s NDR Optimización de la interconexión de baja latencia

August 26, 2026

NVIDIA Mellanox 920-9B210-00FN-0D0 Referencia técnica: 400Gb/s NDR Optimización de la interconexión de baja latencia

NVIDIA Mellanox 920-9B210-00FN-0D0 Referencia técnica: 400Gb/s NDR Optimización de interconexión de baja latencia para racimos RDMA/HPC/AI

1Antecedentes del proyecto y análisis de los requisitos

A medida que los clústeres de capacitación de IA superan las 4.000 GPU y las simulaciones de HPC se acercan al rendimiento de exascala, los tejidos de red se enfrentan a demandas sin precedentes de ancho de banda, latencia y determinismo.El cambio de 200Gb/s HDR a 400Gb/s NDR ya no es opcional para las organizaciones que se dirigen a modelos de trillones de parámetros o simulaciones meteorológicas a escala de kilómetros, es un imperativo estratégicoLos requisitos clave identificados en las principales investigaciones y implementaciones empresariales incluyen:

  • Latencia determinística muy baja:Sub-100ns de puerto a puerto de latencia para minimizar MPI y todo-a-todos de comunicación sobrecarga.
  • Tejido sin pérdidas a escala:Los paquetes cero caen bajo congestión en miles de puntos finales, asegurando que el rendimiento de RDMA siga siendo predecible.
  • Descarga de computación en red:Descargar operaciones colectivas (todo-reducir, todo-a-todos, transmisión) al tejido de red para maximizar la utilización de la GPU.
  • Escalabilidad de alta radix:Soporte para topologías de gran escala de árbol de grasa y libélula + con ancho de banda de bisección completo de hasta 8,000 + nodos.
  • Protección de las inversiones:Compatibilidad perfecta con los cables HDR existentes, la óptica y las herramientas de gestión para permitir actualizaciones por fases.

Para hacer frente a estos requisitos, esta solución adopta laNVIDIA Mellanox 920-9B210-00FN-0D0 también está disponible en vivo.como el bloque de construcción central – un interruptor NDR InfiniBand de 400Gb/s que ofrece la densidad, el rendimiento y la inteligencia requeridos para las implementaciones de clase exascala.

2Diseño general de la arquitectura de red

La solución propuesta emplea una topología de espina dorsal de hojas de dos niveles, que proporciona un tejido escalable y no bloqueante con latencia determinista y cableado simplificado.cada rack de computación está equipado con uno o dos920-9B210-00FN-0D0 InfiniBand conmutador OPNEn la capa de columna vertebral, un segundo nivel de conectividad NDR se encuentra situado en la parte superior de la columna vertebral.920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDRLos interruptores interconectan todos los interruptores de hojas, creando un tejido de árbol de grasa de ancho de banda de bisección completa.

Para los clústeres de más de 5.000 nodos, se puede implementar una arquitectura de tres niveles de cierre plegado,con el 920-9B210-00FN-0D0 que sirve tanto como hoja como como columna vertebral para mantener un rendimiento constante en todos los nivelesEl switch admite hasta 64 switches en un solo tejido bajo un único administrador de subred, lo que permite un control unificado de topologías a gran escala.

La siguiente tabla resume los parámetros clave de escala para un tejido NDR de 2 niveles construido alrededor del 920-9B210-00FN-0D0:

Componente Especificación Valor
Las demás: Los requisitos de seguridad de los sistemas de seguridad de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de 1 ¢2 por estante
Interruptores de la columna vertebral Los requisitos de seguridad de los sistemas de seguridad de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de N/2 (N = número de interruptores de hojas)
Puntos finales máximos Servidores de GPU Hasta 4.096 (radix de 64 puertos)
Ancho de banda de bisección No bloqueador completo 51.2 Tb/s por nivel de la columna vertebral

3. Función y características clave del NVIDIA Mellanox 920-9B210-00FN-0D0

Dentro de esta arquitectura, elNVIDIA Mellanox 920-9B210-00FN-0D0 también está disponible en vivo.sirve como elemento de conmutación fundamental, proporcionando varias capacidades críticas que abordan directamente los requisitos identificados en la sección 1:

  • 64 puertos de NDR de 400 Gb/s:Cada puerto OSFP admite 400Gb/s bidireccional con corrección de error hacia adelante (FEC) para una conectividad confiable de alcance extendido.2 Tb/s proporciona un amplio espacio para las cargas de trabajo más intensivas en comunicación.
  • Latencia de corte muy baja:La latencia de puerto a puerto es inferior a 100 ns, como se documenta en elSi el vehículo no está equipado con un dispositivo de seguridad, el vehículo deberá ser equipado con un dispositivo de seguridad., garantiza un mínimo de gastos generales para las operaciones de MPI y RDMA.
  • SHARPv3 integrado (Protocolo de agregación y reducción jerárquica escalable):Descarga las operaciones colectivas de las CPU anfitrionas, reduciendo la latencia de reducción total hasta en un 40% y total hasta en un 35% en trabajos a gran escala.
  • Enrutamiento adaptativo y control de congestión:Reorienta dinámicamente el tráfico para evitar puntos críticos, garantizando un rendimiento predecible en patrones de tráfico adversarios.La telemetría avanzada proporciona visibilidad por flujo y por puerto para una gestión proactiva.
  • Gestión completa:Integración completa con el Administrador de Telas Unificadas (UFM) de NVIDIA para el aprovisionamiento sin contacto, monitoreo de estado y cambio automático de fallo.

ElLas especificaciones 920-9B210-00FN-0D0También se destacan las fuentes de alimentación de doble redundancia, los módulos de ventiladores intercambiables en caliente y el soporte para las configuraciones redundantes del administrador de subred, lo que garantiza una disponibilidad del 99,999% para cargas de trabajo críticas para la misión.

4Recomendaciones de implementación y escalabilidad

Para las organizaciones que planean adoptar el920-9B210-00FN-0D0 Solución OPN de conmutador de banda ancha, se recomiendan las siguientes directrices de implantación:

  • Estrategia de cableado:Utilice cables OSFP-OSFP DAC para las conexiones intra-rack (hasta 3 m) y AOC o transceptores ópticos para los enlaces inter-rack y de espina dorsal (hasta 100 m).920-9B210-00FN-0D0 compatibles con el sistema operativopor la matriz de compatibilidad NVIDIA para evitar problemas de integridad de la señal.
  • Redundancia:Utilice al menos dos interruptores de columna vertebral por hoja para eliminar puntos de falla individuales.Considerar la redundancia N+1 en el nivel de la columna.
  • Administración del firmware:Asegúrese de que todos los switches ejecuten versiones de firmware NVIDIA idénticas.Valida la compatibilidad del firmware con los adaptadores y cables de host antes de su implementación.
  • Ruta de escalabilidad:Para los grupos más allá de 4.096 nodos, transición a una topología de tres niveles plegados-Clos o apalancar libélula + con enrutamiento adaptativo.con múltiples tejidos interconectados a través de pasarelas para despliegues más grandes.
  • Validación del rendimiento:Antes del despliegue de la producción, ejecutar pruebas de esfuerzo completas utilizando herramientas como los puntos de referencia de rendimiento de OpenFabrics Enterprise Distribution (OFED) para validar el rendimiento del tejido frente a laSi el vehículo no está equipado con un dispositivo de seguridad, el vehículo deberá ser equipado con un dispositivo de seguridad.las especificaciones.

Cuando se calcula el coste total de propiedad, se tiene en cuenta el número reducido de niveles de interruptores y el cableado simplificado en comparación con las alternativas de radix más bajo.920-9B210-00FN-0D0 precioEl costo por puerto y el costo de red por GPU son significativamente más bajos en implementaciones a gran escala, lo que lo convierte en una opción rentable para proyectos de exascala.

5. Operaciones, seguimiento y solución de problemas

La gestión efectiva de un tejido NDR requiere un marco integral de monitoreo y solución de problemas.NVIDIA Mellanox 920-9B210-00FN-0D0 también está disponible en vivo.- con base de tejidos, ofreciendo:

  • Visualización de la topología:Descubrimiento automático y representación gráfica de todos los interruptores, enlaces y puntos finales, con actualizaciones de estado en tiempo real.
  • Tableros de rendimiento:Vistas en tiempo real de la utilización del puerto, las tasas de error, los indicadores de congestión y la ocupación del búfer en todo el tejido.
  • Alerta proactiva:Alarmas basadas en umbrales para la degradación del enlace, anomalías de temperatura, fallos de alimentación y desgaste del cable.
  • Aislamiento de fallas:Flujos de trabajo de solución de problemas guiados que identifican cables defectuosos, transceptores o puertos de conmutación, reduciendo el tiempo medio de resolución (MTTR).
  • Análisis histórico:Análisis de tendencias y planificación de la capacidad basados en datos históricos de rendimiento, que permitan tomar decisiones proactivas de escalado.

Para una solución de problemas avanzada, aproveche las herramientas de diagnóstico integradas del interruptor, incluidas las pruebas de bucle, el análisis BER (tasa de error de bits) y el monitoreo de diagnóstico del módulo óptico (DOM).Los problemas comunes encontrados en las primeras implementaciones de NDR incluyen enrutamiento subóptimo causado por velocidades de enlace desiguales, tipos de cable no coincidentes, o inconsistencias de firmware. habilitando el enrutamiento adaptativo, verificando que todos los enlaces están operando a 400Gb/s con FEC habilitado,y asegurar firmware consistente en todos los switches resuelve la mayoría de las anomalías de rendimiento.

Los ingenieros de red también deben establecer una línea de base deLas especificaciones 920-9B210-00FN-0D0Las diferencias de esta línea de base pueden utilizarse como indicadores tempranos de posibles problemas.920-9B210-00FN-0D0 InfiniBand conmutador OPNTambién admite un registro de eventos completo a través de syslog y SNMP, lo que permite la integración con las pilas de monitoreo de centros de datos existentes.

6Resumen y evaluación del valor

ElLos requisitos de seguridad de los sistemas de seguridad de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas de seguridad de los sistemas deofrece una propuesta de valor convincente para las organizaciones que construyen o amplían los clústeres de HPC y IA basados en NDR. Proporciona 64 puertos de NDR de 400Gb/s con latencia inferior a 100ns, descarga SHARPv3,capacidad de gestión a nivel empresarial, y la plena compatibilidad con el ecosistema HDR existente, todo en una plataforma compacta de 1U. Los puntos clave incluyen:

  • El rendimiento:Hasta una reducción del 75% en la latencia de comunicación de todo a todo y hasta una reducción del 40% en la latencia de todo a través de la descarga de SHARPv3 y el ancho de banda NDR.
  • Eficiencia de los costes:Menor costo de red por GPU en comparación con las alternativas HDR en implementaciones a gran escala, impulsado por un mayor radix y un menor número de capas de conmutación.
  • Simplicidad de funcionamiento:Integración profunda con UFM para una gestión unificada, aprovisionamiento automatizado, monitoreo proactivo y resolución rápida de fallos.
  • Protección de las inversiones:Compatibilidad completa con los cables HDR, ópticas y pilas de software existentes, lo que permite actualizaciones por fases sin interrumpir las cargas de trabajo de producción.
  • Escalabilidad a prueba de futuro:Soporte para topologías de tres niveles plegadas-Clos y libélula +, asegurando que el tejido pueda escalar a más de 8,000 nodos a medida que crecen las demandas de cómputo.

Para las organizaciones que evalúan el920-9B210-00FN-0D0 para la ventaA través de los socios de canal de NVIDIA, recomendamos revisar el detalladoSi el vehículo no está equipado con un dispositivo de seguridad, el vehículo deberá ser equipado con un dispositivo de seguridad.En el caso de los proyectos de diseño de soluciones, el diseño debe ser diseñado de manera que los clientes puedan utilizarlo para sus necesidades específicas de trabajo y escala.NVIDIA Mellanox 920-9B210-00FN-0D0 también está disponible en vivo.está listo para la producción hoy, ofreciendo una base de interconexión escalable y de alto rendimiento para la próxima generación de innovación en IA y HPC.