NVIDIA Mellanox 920-9B110-00FH-0D0 en la práctica: Optimización de tejidos RDMA de baja latencia para clústeres de HPC e IA
August 25, 2026
NVIDIA Mellanox 920-9B110-00FH-0D0 en la práctica: Optimización de las telas RDMA de baja latencia para los clústeres de HPC y IA
Antecedentes y el desafío: Cuando el rendimiento HDR cumple con la realidad del presupuesto
Un laboratorio de investigación de IA de tamaño medio se enfrentó recientemente a un desafío familiar: su tejido EDR InfiniBand de 100Gb/s existente se estaba convirtiendo en un cuello de botella para su cluster de GPU en expansión,que había crecido de 128 a 512 nodos NVIDIA A100Los tiempos de formación de los modelos de transformadores a gran escala habían aumentado en más del 40% debido a la congestión de la red durante las operaciones de reducción total.y el equipo necesitaba una actualización que pudiera ofrecer ganancias de rendimiento sustanciales sin el gasto de capital requerido para un despliegue completo de NDR de 400Gb/s.
El laboratorio evaluó varias opciones e identificó 200Gb/s HDR como el equilibrio ideal de rendimiento y costo.Control avanzado de la congestión, y la integración perfecta con sus cables y transceptores compatibles con HDR existentes.NVIDIA Mellanox 920-9B110-00FH-0D0 fue lanzado por NVIDIA en julio de 2010.En la imagen anterior se ha introducido un interruptor diseñado específicamente para entornos en los que HDR proporciona un ancho de banda amplio sin sobreprovisionamiento.
Solución y implementación: un tejido HDR optimizado en costos
El laboratorio desplegó el920-9B110-00FH-0D0 InfiniBand conmutador OPNCada rack de computación recibió un switch basado en MQM8790-HS2F, la plataforma de silicio subyacente al sistema de computación.920-9B110-00FH-0D0 MQM8790-HS2F 200Gb/s HDRProporcionar 40 puertos de conectividad de 200 Gb/s a los servidores de GPU a través de cables de conexión directa OSFP-OSFP.creando un tejido de árbol de grasa sin bloqueo con ancho de banda de bisección completo.
Lo que hizo que este despliegue fuera particularmente eficaz fue la tecnología integrada SHARPv2 (Protocolo de Agregación y Reducción Jerárquica Escalable),que descargaron las operaciones de comunicación colectiva directamente en el tejido del interruptorEn la práctica, esto significaba que las operaciones de reducción total, que antes consumían ciclos significativos de CPU de host y ancho de banda de la red, no podían realizarse sin la ayuda de un ordenador.Los trabajos se completaron ahora en un solo paso a través del tejido, reduciendo drásticamente los tiempos de finalización de los trabajos..
De acuerdo con elSi el vehículo no está equipado con un dispositivo de seguridad, el vehículo deberá ser equipado con un dispositivo de seguridad.El equipo de ingenieros también confirmó que el interruptor proporciona una latencia de corte sub-200ns, que se alineó estrechamente con los requisitos de rendimiento del laboratorio.920-9B110-00FH-0D0 compatibles con el sistema operativoEl sistema incluyó todos los tipos de cables y ópticas que ya habían estandarizado, eliminando la necesidad de costosos esfuerzos de recablado.
Resultados y beneficios medibles: de cuello de botella a facilitador
Después del despliegue, el laboratorio midió mejoras en varias dimensiones críticas:
- Reducción del tiempo de finalización del trabajo:Las iteraciones de entrenamiento para un modelo de parámetros 13B disminuyeron en un 35%, con una latencia total reducida de 12 μs a menos de 5 μs para tamaños colectivos típicos.
- Utilización de la red:La utilización promedio del tejido aumentó del 58% al 83% sin provocar congestión, gracias a los mecanismos de routing adaptativo y control de congestión del interruptor.
- Eficiencia de energía y refrigeración:En comparación con el tejido EDR anterior, la nueva infraestructura HDR redujo el consumo de energía por puerto en un 30%, lo que permitió al laboratorio agregar más nodos de cómputo sin exceder su presupuesto de energía del centro de datos.
Desde la perspectiva del coste total de propiedad, el920-9B110-00FH-0D0 precioEl coste de los servicios de la empresa por puerto fue significativamente inferior a las alternativas NDR, lo que permitió al laboratorio actualizar toda su estructura dentro de su presupuesto existente.Las especificaciones 920-9B110-00FH-0D0También destacó las fuentes de alimentación redundantes del interruptor y los módulos de ventilador intercambiables en caliente, que contribuyeron al objetivo del laboratorio de disponibilidad del 99,999% para sus trabajos de capacitación de producción.
Los ingenieros de red señalaron que el920-9B110-00FH-0D0 Solución OPN de conmutador de banda anchaintegrado a la perfección con el Administrador Unificado de Telas (UFM) de NVIDIA, proporcionando una visibilidad centralizada de la salud de los tejidos y alertas automatizadas.Esto redujo significativamente el tiempo dedicado a la resolución de problemas y el mantenimiento proactivo, liberando al equipo para centrarse en optimizar sus canales de formación en lugar de administrar la red.
Resumen y perspectivas: La Fundación HDR de tamaño adecuado
ElNVIDIA Mellanox 920-9B110-00FH-0D0 fue lanzado por NVIDIA en julio de 2010.demostró ser la opción correcta para este laboratorio de investigación, ofreciendo el rendimiento de 200Gb/s HDR a una estructura de costos que tenía sentido comercial.capacidades de computación en red, y características de gestión sólidas, el laboratorio transformó su red de un cuello de botella de rendimiento en una base escalable para el crecimiento futuro.
Mirando hacia el futuro, el laboratorio planea escalar su clúster a 1.024 nodos en los próximos 18 meses.Tienen confianza en que su red puede crecer junto con su capacidad de cómputoPara las organizaciones que evalúan sus opciones de infraestructuras de RHD, el920-9B110-00FH-0D0 para la ventaA través de los socios de canal de NVIDIA ofrece una solución convincente y validada para la producción que equilibra el rendimiento, la densidad y el costo.

