Referencia Técnica NVIDIA Mellanox 920-9B110-00FH-0D0: Interconexión Optimizada de Baja Latencia para RDMA/HPC/IA
August 25, 2026
NVIDIA Mellanox 920-9B110-00FH-0D0 Referencia técnica: Interconexión optimizada de baja latencia para racimos RDMA / HPC / AI a 200Gb / s HDR
1Antecedentes del proyecto y análisis de los requisitos
A medida que los clústeres de HPC e IA continúan creciendo, las cargas de trabajo de capacitación distribuida y simulación científica exigen un ancho de banda, latencia y escalabilidad de red cada vez más estrictos. not every cluster requires 400Gb/s NDR infrastructure—a significant number of production environments are already standardized on 200Gb/s HDR and seek performance improvements within a controlled budgetLos requisitos típicos incluyen:
- Baja latencia determinística:La comunicación colectiva del MPI debe mantener un retraso de puerto a puerto de menos de un microsegundo, evitando que la latencia de cola afecte a la convergencia de la formación.
- Fabricación en la que no se utilicen las siguientes materias:El paquete cero cae bajo congestión para garantizar la eficiencia de RDMA y evitar el colapso del rendimiento.
- Descarga de computación en red:Descargar operaciones colectivas como All-Reduce en el tejido de red para liberar los recursos de la CPU/GPU del host.
- Escalabilidad fluida:Soporte para la expansión sin bloqueo de cientos a miles de nodos, con compatibilidad para cables HDR existentes y transceptores ópticos.
Para hacer frente a estos requisitos, esta solución adopta laNVIDIA Mellanox 920-9B110-00FH-0D0 fue lanzado por NVIDIA en julio de 2010.como el bloque básico de construcción de un switch HDR InfiniBand de 200Gb/s que equilibra el rendimiento, la densidad y la rentabilidad para despliegues de mediana a gran escala.
2Diseño general de la arquitectura de red
La solución propuesta emplea una topología de dos niveles de la columna vertebral de las hojas, que proporciona un tejido escalable y no bloqueante con latencia predecible y cableado simplificado.cada rack de computación está equipado con una920-9B110-00FH-0D0 InfiniBand conmutador OPN(número de pieza de pedido), que ofrece 40 puertos de conectividad HDR de 200Gb/s a servidores GPU a través de OSFP-OSFP de conexión directa de cobre (DAC) o de cables ópticos activos (AOC).un segundo nivel de interruptores MQM8790-HS2F920-9B110-00FH-0D0 MQM8790-HS2F 200Gb/s HDR¢interconecta todos los interruptores de hojas, creando un tejido de árbol de grasa de ancho de banda de bisección completa.
Para los clusters más grandes que superen los 1.500 nodos, se puede implementar una arquitectura de clausura plegada de tres niveles,con el 920-9B110-00FH-0D0 que sirve tanto como hoja como como columna vertebral para mantener un rendimiento constante en todos los nivelesLa siguiente tabla resume los parámetros clave de escala para un tejido HDR de 2 niveles construido alrededor de este interruptor:
| Componente | Especificación | Valor |
|---|---|---|
| Las demás: | Las condiciones de los requisitos de seguridad de los equipos de seguridad deberán ser las siguientes: | 1 por estante |
| Interruptores de la columna vertebral | Las condiciones de los requisitos de seguridad de los equipos de seguridad deberán ser las siguientes: | N/2 (N = número de interruptores de hojas) |
| Puntos finales máximos | Servidores de GPU | Hasta 1.600 (radix de 40 puertos) |
| Ancho de banda de bisección | No bloqueador completo | 8.0 Tb/s por nivel de la columna vertebral |
3. Papel y características clave del NVIDIA Mellanox 920-9B110-00FH-0D0
Dentro de esta arquitectura, elNVIDIA Mellanox 920-9B110-00FH-0D0 fue lanzado por NVIDIA en julio de 2010.sirve como el elemento de conmutación fundamental, proporcionando varias capacidades críticas:
- 40 puertos de 200 Gb/s HDR:Cada puerto OSFP admite 200Gb/s bidireccional con corrección de error hacia adelante (FEC) para una conectividad confiable de alcance extendido.
- SHARPv2 integrado (Protocolo de agregación y reducción jerárquica escalable):Descarga las operaciones de comunicación colectiva, reduciendo la latencia de MPI All-Reduce hasta en un 30% en cargas de trabajo típicas de HPC.
- Enrutamiento adaptativo y control de congestión:Reorienta dinámicamente el tráfico para evitar puntos críticos, garantizando un rendimiento predecible en patrones de tráfico adversarios.
- Telemetría avanzada:Los contadores por flujo y por puerto, junto con el monitoreo de la ocupación del búfer, proporcionan una visibilidad profunda de la salud del tejido.
De acuerdo con elSi el vehículo no está equipado con un dispositivo de seguridad, el vehículo deberá ser equipado con un dispositivo de seguridad., el switch ofrece una latencia de corte de hasta 200ns y admite hasta 8,0 Tb/s de capacidad de conmutación agregada.Las especificaciones 920-9B110-00FH-0D0también destacar las fuentes de alimentación redundantes y los módulos de ventiladores intercambiables en caliente, garantizando una disponibilidad del 99,999% para las cargas de trabajo críticas para la misión.
4Recomendaciones de implementación y escalabilidad
Para las organizaciones que planean adoptar el920-9B110-00FH-0D0 Solución OPN de conmutador de banda ancha, se recomiendan las siguientes directrices de implantación:
- Estrategia de cableado:Utilice cables OSFP-OSFP DAC para las conexiones intra-rack (hasta 3 m) y AOC o transceptores ópticos para los enlaces inter-rack y de espina dorsal (hasta 100 m).920-9B110-00FH-0D0 compatibles con el sistema operativopor la matriz de compatibilidad NVIDIA.
- Redundancia:Utilice dos fuentes de alimentación conectadas a PDU separadas y al menos dos interruptores por hoja para eliminar puntos de falla individuales.
- Administración del firmware:Asegúrese de que todos los switches ejecuten versiones de firmware NVIDIA idénticas.
- Ruta de escalabilidad:Para los grupos más allá de 1.600 nodos, transición a una topología de tres niveles plegados-Clos o apalancar la libélula + con enrutamiento adaptativo.El 920-9B110-00FH-0D0 admite hasta 64 switches en un solo tejido bajo un solo administrador de subred.
Cuando se calcula el coste total de propiedad, se tiene en cuenta el número reducido de niveles de interruptores y el cableado simplificado en comparación con las alternativas de radix más bajo.920-9B110-00FH-0D0 precioEl coste por puerto es significativamente más bajo que el de NDR, lo que lo convierte en una opción óptima para despliegues HDR con conciencia de costes.
5. Operaciones, seguimiento y solución de problemas
La gestión efectiva de un tejido HDR requiere un marco integral de monitoreo y solución de problemas.NVIDIA Mellanox 920-9B110-00FH-0D0 fue lanzado por NVIDIA en julio de 2010.- con base de tejidos, ofreciendo:
- Visualización de la topología:Descubrimiento automático y representación gráfica de todos los interruptores, enlaces y puntos finales.
- Tableros de rendimiento:Vistas en tiempo real de la utilización del puerto, las tasas de error e indicadores de congestión.
- Alerta proactiva:Alarmas basadas en umbrales para la degradación del enlace, anomalías de temperatura y fallos de suministro de energía.
- Aislamiento de fallas:Flujos de trabajo de solución de problemas guiados que identifican cables defectuosos, transceptores o puertos de interruptor.
Para solucionar problemas avanzados, aproveche las herramientas de diagnóstico integradas del interruptor, incluidas las pruebas de ciclo y el análisis BER (tasa de error de bits),para validar la integridad del enlace antes de desplegar cargas de trabajo de producciónLos problemas comunes que se encuentran en las implementaciones tempranas incluyen el enrutamiento subóptimo causado por velocidades de enlace desiguales o tipos de cable no coincidentes.Habilitar el enrutamiento adaptativo y verificar que todos los enlaces estén operando a 200Gb / s (con FEC habilitado) resuelve la mayoría de las anomalías de rendimientoEl.920-9B110-00FH-0D0 InfiniBand conmutador OPNTambién admite configuraciones redundantes de administradores de subred, lo que garantiza que la reconfiguración del tejido se realice sin intervención manual en caso de fallo de un nodo de administración.
6Resumen y evaluación del valor
ElLas condiciones de los requisitos de seguridad de los equipos de seguridad deberán ser las siguientes:ofrece una propuesta de valor convincente para las organizaciones que construyen o amplían clústeres de HPC y IA basados en HDR. Proporciona 40 puertos de HDR de 200Gb/s con latencia inferior a 200ns, descarga SHARPv2,y la gestión de nivel empresarial en una plataforma 1U rentableLos puntos de valor clave incluyen:
- El rendimiento:Hasta un 35% de reducción en los tiempos de finalización de los trabajos para cargas de trabajo intensivas en comunicación a través de la descarga SHARPv2 y el enrutamiento adaptativo.
- Eficiencia de los costes:Un menor TCO en comparación con las alternativas NDR, con costes por puerto optimizados para despliegues a escala HDR.
- Simplicidad de funcionamiento:Integración profunda con UFM para una gestión unificada, monitoreo proactivo y cambio automático de fallo.
- Protección de las inversiones:Compatibilidad completa con los cables HDR, óptica y software existentes, lo que permite actualizaciones por fases sin interrumpir la producción.
Para las organizaciones que evalúan el920-9B110-00FH-0D0 para la ventaA través de los socios de canal de NVIDIA, recomendamos revisar el detalladoSi el vehículo no está equipado con un dispositivo de seguridad, el vehículo deberá ser equipado con un dispositivo de seguridad.En el caso de los proyectos de diseño de soluciones, el diseño debe ser diseñado de manera que los clientes puedan utilizarlo para sus necesidades específicas de trabajo y escala.NVIDIA Mellanox 920-9B110-00FH-0D0 fue lanzado por NVIDIA en julio de 2010.El objetivo de este proyecto es mejorar la calidad de la información y la calidad de la información en el mercado.

