Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 Solución técnica del conmutador de banda ancha

July 15, 2026

Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 Solución técnica del conmutador de banda ancha

Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand Switch Solución técnica. Optimización de interconexión de baja latencia para grupos RDMA / HPC / AI

1Antecedentes del proyecto y análisis de los requisitos

Los modernos marcos de capacitación de IA y las aplicaciones de HPC están cada vez más limitados por el rendimiento de la interconexión de red en lugar de la densidad de cómputo sola.Los trabajos de formación distribuidos, en particular los que utilizan grandes modelos lingüísticos, generanLos requisitos clave identificados en las implementaciones empresariales incluyen:latencia de interruptor de submicrosegundos para minimizar la carga de comunicación, un rendimiento no bloqueante a escala para eliminar la sobre suscripción, un control avanzado de la congestión para manejar los estallidos incas,y integración perfecta con RDMA a través de Ethernet convergente (RoCE) o ecosistemas nativos de InfiniBandAdemás, los equipos operativos exigen una telemetría profunda para la detección proactiva de fallas y una gestión simplificada en cientos de puertos.

2Diseño general de la arquitectura de red/sistema

La arquitectura propuesta se centra en una topología de dos niveles de hoja-espina dorsal, especialmente diseñada para cargas de trabajo centradas en la GPU.Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 (incluido el juego)como el switch principal ToR (Top-of-Rack), que conecta hasta 40 nodos de cómputo a través de enlaces NDR de 400Gb/s. La capa de columna vertebral consta de un segundo nivel de920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDRlos interruptores, que proporcionan una conectividad de malla completa con sobrescripción de 4:1 o totalmente no bloqueantes cuando se implementan con puertos espinales suficientes.Este diseño admite hasta 512 nodos de GPU en un solo dominio de tela, con la opción de escalar horizontalmente a través de múltiples subredes interconectadas a través del UFM (Unified Fabric Manager) de NVIDIA.

La arquitectura aprovecha el motor de computación en red SHARPv3 de NVIDIA (Scalable Hierarchical Aggregation and Reduction Protocol), descargando las operaciones colectivas directamente en el switch ASIC.Esto reduce el volumen de datos que atraviesan los buses de memoria CPU/GPU y reduce la latencia de operación colectiva hasta en un 40% en comparación con los enfoques basados en softwareEl.920-9B210-00FN-0D0 InfiniBand conmutador OPNTambién admite enrutamiento adaptativo, que selecciona dinámicamente la ruta menos congestionada para cada paquete, asegurando una utilización óptima del ancho de banda incluso bajo cargas de tráfico asimétricas.

3. Función y características clave del 920-9B210-00FN-0D0 en la solución

ElNVIDIA Mellanox 920-9B210-00FN-0D0 también está disponible en vivo.sirve como el bloque de construcción fundamental para todo el tejido de interconexión.

  • Agregación de alta densidad:Con hasta 64 puertos de 400Gb/s sin bloqueo en un factor de forma de 2U, el switch ofrece una capacidad de conmutación total de 25,6 Tb/s. Esta densidad reduce el número de switches necesarios por rack,simplificación del cableado y reducción del consumo de energía por puerto.
  • Conmutación de latencia ultra baja:El switch mantiene una latencia inferior a 600ns para cualquier tamaño de paquete, crítico para aplicaciones sensibles a la latencia de cola, como la inferencia en línea y la HPC financiera.
  • Computación en red:La integración de SHARPv3 permite la aceleración de hardware de las operaciones colectivas, reduciendo el número de travesías a través del tejido y mejorando los tiempos de finalización de trabajos en un 30%.
  • Telemetría avanzada y control de congestión:El interruptor proporciona visibilidad por flujo, marcando flujos congestionados para ajustes del lado del host y permitiendo una alerta temprana de puntos críticos incipientes.

De acuerdo con elSi el vehículo no está equipado con un dispositivo de seguridad, el vehículo deberá ser equipado con un dispositivo de seguridad., el interruptor es compatible con los transceptores QSFP-DD de cobre y ópticos, por lo que920-9B210-00FN-0D0 compatibles con el sistema operativoEl sistema de cableado de los centros de datos, con su flujo de aire de frente a atrás y sus fuentes de alimentación redundantes, garantizan una alta disponibilidad en entornos empresariales.

4Recomendaciones de implementación y escalado (topología típica)

Para una implementación de campo verde de 128 nodos GPU, recomendamos una arquitectura de dos niveles con 4 interruptores de hoja y 2 interruptores de columna vertebral,Cada columna vertebral se conecta a cada hoja a través de 4x400Gb/s uplinksPara las aplicaciones sensibles a la latencia o de gran ancho de banda, un 1:Se puede lograr un diseño no bloqueante aumentando el recuento de columna vertebral a 4., lo que produce una capacidad agregada de enlace ascendente igual a los puertos de enlace descendente.

Para escalar más allá de los 512 nodos, se requiere dividir el tejido en múltiples subredes, cada una administrada por UFM como una isla de tejido distinta.La comunicación entre subredes se puede enrutar a través de las pasarelas Quantum-2 de NVIDIA o a través de enrutamiento basado en hostEn el caso de las cargas de trabajo sensibles al rendimiento, el enfoque recomendado es mantener el tejido dentro de una sola subred siempre que sea posible.Las especificaciones 920-9B210-00FN-0D0apoyar estas topologías a gran escala, con control de flujo incorporado y control de flujo basado en prioridades (PFC) para evitar caídas de paquetes durante eventos de redireccionamiento de la ruta.

Al planificar el cableado físico, considere el uso de cables de ruptura MPO a QSFP-DD para conexiones de columna vertebral para reducir la densidad del cable, o cables ópticos activos (AOC) para distancias superiores a 3 metros.920-9B210-00FN-0D0 para la ventapor lo general incluye un kit de accesorios completo, pero recomendamos validar la compatibilidad del transceptor de terceros a través de la matriz de interoperabilidad del proveedor para evitar problemas de capacitación de enlace.

5. Operaciones, monitoreo y diagnóstico de fallas

La excelencia operativa es una piedra angular del920-9B210-00FN-0D0 Solución OPN de conmutador de banda anchaEl interruptor se integra perfectamente con la plataforma UFM de NVIDIA, que proporciona:

  • Monitoreo de la salud de los tejidos en tiempo real:Tableros de control para el estado del enlace, la temperatura, el consumo de energía y los contadores de errores por puerto (CRC, símbolo y errores de alineación).
  • Análisis de fallas predictivo:Los modelos de aprendizaje automático en UFM identifican de forma proactiva las ópticas defectuosas o los enlaces deteriorados antes de que causen fallas en el trabajo.
  • Solución automática de problemas:El sistema recomienda acciones correctivas, como redirigir el tráfico o aislar los enlaces defectuosos, reduciendo significativamente el tiempo medio de resolución (MTTR).

Para diagnósticos avanzados, el switch admite el sFlow y el espejo de puertos, lo que permite la inspección profunda de paquetes para la depuración a nivel de protocolo.Las especificaciones 920-9B210-00FN-0D0para los umbrales de búfer y la configuración recomendada, en particular para ajustar el tráfico RoCEv2 si se utiliza en entornos mixtos InfiniBand/Ethernet.El ajuste de rendimiento debe centrarse en los umbrales de enrutamiento adaptativo e intervalos de agregación SHARPv3, que se puede ajustar por fase de carga de trabajo, por ejemplo, formación versus inferencia.

El mantenimiento de rutina incluye actualizaciones de firmware que se realizan con una interrupción mínima utilizando la capacidad de actualización continua de UFM,y limpieza periódica de los conectores ópticos para mantener la integridad de la señalLa energía redundante del interruptor y los módulos de ventilador permiten el intercambio en caliente durante el funcionamiento.

6Resumen y evaluación del valor

ElMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 (incluido el juego)ofrece una solución integral para las organizaciones que buscan desbloquear el pleno rendimiento de sus inversiones en IA y HPC.La gestión inteligente de la congestión en unLa arquitectura descrita proporciona un camino comprobado desde los clústeres piloto de 128 nodos hasta los centros de datos modernos.Fabricados para la supercomputación, con herramientas operativas que simplifican la gestión y reducen el coste total de propiedad.

En la evaluación de la920-9B210-00FN-0D0 precio, considera el valor a largo plazo: los tiempos de finalización reducidos de los trabajos se traducen directamente en menores costes en la nube o en un tiempo de comprensión más rápido para las cargas de trabajo locales.920-9B210-00FN-0D0 Solución OPN de conmutador de banda anchaestá respaldado por la red de soporte global de NVIDIA y el extenso ecosistema de socios, lo que garantiza que las organizaciones puedan implementar, escalar y optimizar con confianza su infraestructura en los próximos años.


Para una planificación detallada, consulte elSi el vehículo no está equipado con un dispositivo de seguridad, el vehículo deberá ser equipado con un dispositivo de seguridad.yLas especificaciones 920-9B210-00FN-0D0documento, que incluye dibujos mecánicos, perfiles térmicos y puntos de referencia de rendimiento.