Documento técnico sobre el switch InfiniBand NVIDIA Mellanox MQM8790-HS2F
August 21, 2026
Informe técnico del conmutador NVIDIA Mellanox MQM8790-HS2F InfiniBand: Optimización de la interconexión de baja latencia para clústeres RDMA/HPC/AI
Este documento técnico está destinado a arquitectos de redes, ingenieros de preventa y gerentes de operaciones. Se centra en elNVIDIA Mellanox MQM8790-HS2FConmutador InfiniBand HDR de 200 Gb/s, que proporciona un diseño de solución integral para la optimización de interconexión de baja latencia en clústeres de inteligencia artificial (AI) y computación de alto rendimiento (HPC) acelerados por RDMA. El documento cubre el diseño de arquitectura, tecnologías clave, estrategias de implementación y escalamiento, monitoreo de operaciones y evaluación de valor, ofreciendo un modelo reproducible para la infraestructura informática con uso intensivo de datos de próxima generación.
1. Análisis de requisitos y antecedentes del proyecto
A medida que los parámetros del modelo de IA alcanzan magnitudes de escala de billones y las simulaciones de HPC exigen una resolución cada vez más fina, la estructura de la red subyacente ha evolucionado de un componente de soporte a un determinante primario del rendimiento. Los trabajos de capacitación distribuidos, por ejemplo, pueden dedicar entre el 40% y el 60% de su tiempo de ejecución a operaciones de comunicación colectiva si la interconexión carece de suficientes características de ancho de banda y latencia. Para los equipos de TI empresariales, esto se traduce directamente en un mayor tiempo de comercialización para las iniciativas de IA e inversiones en GPU infrautilizadas.
Los requisitos clave identificados a través de amplias interacciones con los clientes incluyen:
- Latencia ultrabaja y predecible:Conmutación de corte inferior a 200 ns para tráfico MPI y RDMA, con una fluctuación mínima en disputa.
- Rendimiento sin bloqueo:Rendimiento sostenido de velocidad de línea en todos los puertos simultáneamente, eliminando la formación de puntos de acceso y la degradación de la latencia de cola.
- Cálculo dentro de la red:Aceleración de hardware para operaciones colectivas (reducción total, transmisión, barrera) para descargar las CPU del host y reducir el movimiento de datos.
- Soporte de topología escalable:Capacidad para crear topologías de árbol grueso, toroide o libélula+ que abarquen de cientos a miles de nodos sin capas de conmutación excesivas.
- Gestión simplificada:Monitoreo de tejido unificado, descubrimiento automatizado de topología y detección proactiva de fallas para reducir la sobrecarga operativa.
ElMQM8790-HS2Ffue seleccionado como el bloque de construcción óptimo para esta arquitectura de solución, con su diseño preliminarHoja de datos de MQM8790-HS2Flo que confirma 40 puertos de 200 Gb/s HDR, latencia de corte inferior a 130 ns y compatibilidad con computación en red SHARP v3.0, capacidades que se asignan directamente a los requisitos anteriores.
2. Diseño general de la arquitectura del sistema/red
La arquitectura propuesta emplea una topología de árbol grueso de columna de hoja de dos niveles para clústeres de hasta 1200 nodos, con la opción de extenderse a tres niveles para implementaciones más grandes. Esta topología equilibra el rendimiento, el costo y la capacidad de administración, proporcionando un ancho de banda de bisección completo y una latencia determinista en todo el tejido.
| Nivel | Tipo de dispositivo | Recuento de puertos (usado) | Función de conectividad |
|---|---|---|---|
| Hoja | MQM8790-HS2F | 32 x 200 Gb/s (16 a nodos, 16 a columnas) | Agrega tráfico de nodos de computación |
| Columna vertebral | MQM8790-HS2F | 40 x 200 Gb/s (todos a conmutadores de hoja) | Conexión cruzada sin bloqueo entre hojas. |
Cada conmutador de hoja conecta hasta 16 nodos de computación a través de adaptadores de canal de host NVIDIA ConnectX-6 o ConnectX-7 HDR, utilizando elCompatible con MQM8790-HS2Fecosistema óptico, incluidos cables ópticos activos (AOC) y DAC de cobre pasivos, según la distancia del enlace. ElMQM8790-HS2F 200 Gb/s HDR 40 puertos QSFP56El diseño proporciona una amplia densidad para la agregación a nivel de rack y al mismo tiempo mantiene un factor de forma de 1U para una utilización eficiente del espacio en rack.
Para clústeres que superan los 1200 nodos, se recomienda una topología de tres niveles con una capa superspine adicional. En esta configuración, elSolución de conmutador InfiniBand MQM8790-HS2Fmantiene su función en todos los niveles, lo que simplifica la administración de configuración y repuestos: un solo tipo de conmutador admite toda la estructura, desde el borde hasta el núcleo.
3. Función y características clave de NVIDIA Mellanox MQM8790-HS2F
ElNVIDIA Mellanox MQM8790-HS2Fsirve como elemento de conmutación fundamental en esta arquitectura y ofrece las siguientes capacidades diferenciadoras que impulsan directamente la optimización de la interconexión de baja latencia:
- Velocidad del puerto HDR 200 Gb/s:Duplica el ancho de banda del EDR de la generación anterior (100 Gb/s) al tiempo que mantiene la compatibilidad con HDR100 (100 Gb/s) para entornos de velocidad mixta, protegiendo las inversiones anteriores.
- Conmutación directa con latencia inferior a 130 ns:Minimiza el tiempo que pasan los paquetes dentro del conmutador, lo que es fundamental para las operaciones RDMA sensibles a la latencia y los patrones de comunicación colectiva.
- Computación en red SHARP v3.0:Descarga las operaciones de reducción de las CPU del host a la estructura del conmutador, lo que reduce el tráfico de datos hasta en un 30 % y acelera el rendimiento total para el entrenamiento de IA hasta 2 veces.
- Enrutamiento adaptativo y control de congestión:Distribuye dinámicamente el tráfico a través de múltiples rutas para evitar puntos de acceso, con indicadores de congestión y control de flujo basado en créditos que garantizan una operación sin pérdidas, un requisito previo para el rendimiento de RDMA.
- Telemetría y diagnóstico integrados:Proporciona visibilidad granular de la ocupación del buffer por puerto, tasas de error de enlace y patrones de tráfico, lo que permite una optimización proactiva y un rápido aislamiento de fallas.
Según lo detalladoEspecificaciones de MQM8790-HS2F, el conmutador admite variantes de flujo de aire directo e inverso, lo que se adapta a diversos diseños de refrigeración de centros de datos. Sus fuentes de alimentación duales redundantes y sus módulos de ventilador intercambiables en caliente mejoran aún más la confiabilidad y la facilidad de servicio.
4. Recomendaciones de implementación y expansión (con topología típica)
Para una implementación inicial equilibrada y rentable, se recomiendan las siguientes mejores prácticas:
- Conectividad de nodo a hoja:Utilice cables HDR de 200 Gb/s (DAC de cobre para ≤3 m, AOC para ≤30 m) con elCompatible con MQM8790-HS2FConectores QSFP56. Asegúrese de que los adaptadores del canal host estén configurados para la misma velocidad de enlace y configuración FEC que los puertos del conmutador.
- Conectividad hoja-espina:Implemente AOC de 200 Gb/s o transceptores de fibra óptica multimodo para distancias de hasta 100 m. ElMQM8790-HS2FNegocia automáticamente los parámetros del enlace, simplificando la implementación.
- Planificación de sobresuscripción:Para cargas de trabajo de IA/HPC de uso general, una relación de sobresuscripción de 2:1 (dos nodos de cómputo por enlace ascendente de 200 Gb/s) proporciona un punto óptimo de costo-rendimiento. Para cargas de trabajo con latencia optimizada o que requieren mucho almacenamiento, considere la sobresuscripción 1:1 (completa).
- Ruta de expansión:Al agregar nuevos bastidores, simplemente implemente interruptores de hoja adicionales y conéctelos a los interruptores de columna existentes. Para aumentos significativos de capacidad (duplicar el número de nodos), actualice la capa de columna a una base más alta o agregue un nivel de súper columna.
Al evaluar laPrecio de MQM8790-HS2Fy el costo total de propiedad, considere que la arquitectura unificada (que utiliza el mismo tipo de conmutador en todos los niveles de estructura) reduce los requisitos de inventario de repuestos en aproximadamente un 70 % en comparación con los enfoques de múltiples SKU. Esta simplificación acelera la respuesta a incidentes y minimiza el tiempo de inactividad durante fallas de hardware.
5. Monitoreo, resolución de problemas y optimización de operaciones
Gestión eficaz de unaConmutador InfiniBand MQM8790-HS2FEl entorno requiere un enfoque sistemático para el seguimiento, el diagnóstico y el ajuste del rendimiento.
Mejores prácticas de seguimiento:
- Implemente Unified Fabric Manager (UFM) de NVIDIA para obtener visibilidad centralizada de la estructura, incluidos mapas de topología, mapas de calor de utilización por enlace e histogramas de latencia en tiempo real.
- Supervise los contadores de errores por puerto, en particular errores de CRC, errores de símbolos y eventos de enlace caído, para identificar ópticas o cables degradantes de manera temprana. Configure capturas SNMP para umbrales predefinidos para permitir el mantenimiento proactivo.
- Realice un seguimiento de la eficiencia de la operación colectiva de SHARP a través de los contadores de rendimiento integrados del conmutador, identificando oportunidades para optimizar los patrones de comunicación colectiva a nivel de aplicación.
Solución de problemas comunes:
- Errores de CRC de enlace en puertos específicos:Verifique el asiento de los cables y la limpieza de los conectores ópticos. Si los errores persisten, reemplace el cable o el transceptor. ElHoja de datos de MQM8790-HS2Fproporciona umbrales de diagnóstico detallados por puerto.
- Picos de latencia inesperados:Verifique los puntos críticos de congestión utilizando el análisis de flujo de tráfico de UFM. Es posible que sea necesario reconfigurar el enrutamiento adaptativo para ciertos patrones de tráfico; experimente con diferentes algoritmos de enrutamiento (mínimo versus no mínimo).
- Problemas de partición de tela:Asegúrese de que la clave de partición (PKey) y el administrador de subred IPoIB estén configurados correctamente. El administrador de subred integrado del conmutador proporciona descubrimiento automatizado de estructuras, pero pueden ser necesarios ajustes manuales para entornos de múltiples inquilinos.
Consejos para optimizar el rendimiento:
- Para cargas de trabajo de entrenamiento de IA, habilite SHARP v3.0 y configure bibliotecas de comunicación colectiva (NCCL, OpenMPI) para utilizar las capacidades de descarga del conmutador. Esto puede reducir la latencia total hasta 2 veces para mensajes de gran tamaño.
- Para aplicaciones HPC sensibles a la latencia, considere deshabilitar el enrutamiento adaptativo para imponer una selección de ruta determinista, intercambiando cierta diversidad de rutas por una latencia predecible.
- Revise y actualice periódicamente el firmware del conmutador, ya que NVIDIA publica periódicamente mejoras de rendimiento y parches de seguridad. Consulte elHoja de datos de MQM8790-HS2Fpara matrices de compatibilidad de versiones.
6. Resumen y evaluación de valor
ElNVIDIA Mellanox MQM8790-HS2Fofrece una propuesta de valor convincente para las organizaciones que crean o actualizan clústeres RDMA/HPC/AI. Al ofrecer 200 Gb/s por puerto, latencia inferior a 130 ns y aceleración informática en red dentro de un chasis de 1U y 40 puertos, el conmutador aborda los requisitos de interconexión más estrictos de las cargas de trabajo modernas con uso intensivo de datos.
Los impulsores de valor clave incluyen:
- Escalabilidad del rendimiento:La arquitectura Fat-tree sin bloqueo construida alrededorMQM8790-HS2F 200 Gb/s HDR 40 puertos QSFP56Los nodos escalan de 200 a más de 10 000 nodos sin cambios topológicos fundamentales.
- Eficiencia operativa:Un único tipo de conmutador en todos los niveles de estructura reduce el inventario de repuestos, simplifica la capacitación y acelera la resolución de problemas.
- Protección de inversiones:La compatibilidad con versiones anteriores de HDR100 y EDR permite actualizaciones graduales, mientras que el factor de forma del conmutador y la densidad de puertos se alinean con las futuras hojas de ruta de 400G (NDR).
- Ecosistema probado:La profunda integración con los adaptadores ConnectX de NVIDIA, las DPU BlueField y la plataforma de gestión UFM garantiza la previsibilidad del rendimiento de un extremo a otro.
Para las organizaciones listas para implementar, elMQM8790-HS2F a la ventaa través de la red global de distribuidores autorizados de NVIDIA incluye opciones integrales de soporte, que incluyen repuestos in situ, reemplazo avanzado y suscripciones a actualizaciones de firmware. DetalladoEspecificaciones de MQM8790-HS2Fy los diseños de referencia están disponibles a través del portal de documentación técnica de NVIDIA, y se ofrece consultoría de topología personalizada para implementaciones brownfield o greenfield a gran escala.

