Solución Técnica: Adaptador de Servidor NVIDIA Mellanox MCX631102AN-ADAT – Transporte de Baja Latencia RDMA/RoCE

April 27, 2026

Solución Técnica: Adaptador de Servidor NVIDIA Mellanox MCX631102AN-ADAT – Transporte de Baja Latencia RDMA/RoCE

Este libro técnico proporciona una referencia completa para los arquitectos de red, ingenieros de preventa y líderes de operaciones que planean implementarNVIDIA Mellanox MCX631102AN-ADAT, también conocido como NVIDIA MellanoxLa solución se centra en eliminar la sobrecarga de la pila TCP/IP, lo que permite el transporte RDMA/RoCEv2 de baja latencia,y maximizar el rendimiento del servidor para el almacenamiento, bases de datos y cargas de trabajo de IA.

1Antecedentes del proyecto y análisis de los requisitos

Las arquitecturas modernas de centros de datos se enfrentan a tres desafíos convergentes: el crecimiento explosivo del tráfico este-oeste, el cambio hacia el almacenamiento desagregado (NVMe-oF, vSAN), el crecimiento de la capacidad de almacenamiento de datos (NVMe-oF, vSAN) y el crecimiento de la capacidad de almacenamiento de datos (NVMe-oF, vSAN).y la necesidad de preservar los ciclos de CPU para la lógica de la aplicación en lugar de procesamiento de redLas implementaciones heredadas de 25GbE que utilizan TCP/IP tradicional sufren de alta latencia de cola (200-500μs para operaciones de almacenamiento), un procesamiento excesivo del núcleo por paquete e ineficiente rendimiento de paquetes pequeños.El requisito básico es una baja latencia, un tejido sin pérdidas que permite el acceso directo a la memoria entre servidores sin intervención de la CPU, manteniendo la compatibilidad con la infraestructura Ethernet existente.

2Diseño general de la arquitectura de red y sistema

La solución propuesta adopta una topología de dos niveles de hoja-espina dorsal con configuración sin pérdidas RoCEv2.

  • Capa física:Conexiones SFP28 de 25GbE desde cada servidor de computación/almacenamiento hasta los switches de hoja, enlaces ascendentes de 100GbE o 400GbE desde la hoja hasta la columna vertebral
  • Fabricación de tejidos convergentes:Tejido Ethernet compartido que transporta tanto el tráfico TCP estándar como los flujos sin pérdidas RoCEv2, utilizando la priorización basada en DSCP
  • Control del flujo:Control de flujo de prioridad (PFC) sobre prioridades sin pérdidas, marcado ECN para notificación de congestión y negociación DCBX
  • En el lado del host:Las ranuras PCIe 4.0 x16 dedicadas para cada unoTarjeta de adaptador Ethernet MCX631102AN-ADAT, con SR-IOV habilitado para entornos virtualizados

Para las implementaciones NVMe-oF, cada servidor de almacenamiento aloja dosSe utilizará para la fabricación de las máquinas de la categoría M3Adaptadores: uno para el tráfico de aplicaciones front-end y otro para el tráfico de replicación y reconstrucción back-end, asegurando el aislamiento de fallos y la separación de la calidad de servicio.

3. Función y características clave del MCX631102AN-ADAT en la solución

ElSe aplicará el método de ensayo de la norma de la Nomenclatura de la Unión.sirve como el dispositivo de punto final crítico que permite la aceleración RDMA del lado del host.

Características Beneficio funcional para RDMA/producción
Transporte de equipos y descargas RoCEv2, DCQCN, DCT, coincidencia de etiquetas con cero participación de la CPU para una gestión confiable de la conexión
Interfaz PCIe 4.0 x16 Ancho de banda de host suficiente para un conjunto de velocidades de línea de 50 Gbps (25 Gbps por puerto)
Motor de recepción vectorizado Hardware dispersión-recolección y cabezal de división mejora el rendimiento de paquetes pequeños a 37Mpps por puerto
Una bota segura y una raíz de confianza Verificación de la integridad del firmware para las implementaciones sensibles a la seguridad de las VEN y de los servicios financieros
SR-IOV con hasta 256 VF Paso directo de las colas de RoCE a las máquinas virtuales/contenedores sin gastos generales de virtualización del hipervisor

En referencia a laSe aplicarán las siguientes medidas:, el adaptador también proporciona timestamping de hardware (contador de timestamp de funcionamiento libre con resolución de 1ns), lo que permite un PTP/SyncE preciso para operaciones financieras o aplicaciones de borde de telecomunicaciones.

4Recomendaciones de implementación y escalado (topología típica)

En el caso de las implementaciones de campo negro, se recomienda un enfoque por etapas:

  • Fase 1  Actualización del plano de almacenamiento:DespliegueSe aplicará el método de ensayo de la norma de la Nomenclatura de la Unión.Configurar los puertos de conmutación con prioridades PFC 3 para RoCE y 1 para CNP, utilizando la negociación automática DCBX.
  • Fase 2 Activar el plano de cálculo:Instale adaptadores en servidores de cómputo que ejecutan bases de datos o marcos de IA (TensorFlow, PyTorch con NCCL).
  • Fase 3: consolidación de la red:Migración de cargas de trabajo TCP de alta sensibilidad (análisis en tiempo real, microservicios sidecars) a RoCE con tipos de servicio UC o RC.

Lista de verificación de la topología:

  • Todos los interruptores de hoja deben admitir RoCE sin pérdidas (PFC + ECN) con espacio de cabezal de amortiguador adecuado
  • MTU de extremo a extremo de al menos 2000 bytes (preferiblemente 9000 para cuadros jumbo)
  • La capacidad de acceso de enrutamiento unicast para el tráfico RoCEv2 (puerto UDP 4791)
  • ValidaciónCompatible con el MCX631102AN-ADATlista: NVIDIA Spectrum (preferido), Cisco Nexus 9300-EX/FX, Arista 7050X/7050X3 con perfiles DCBX

5. Operaciones y mantenimiento ️ Monitoreo, solución de problemas y optimización

El éxito del despliegue de la producción depende de una telemetría adecuada y una gestión proactiva de las excepciones.

  • Detección de congestión:Monitorear los contadores de marcos de pausa PFC por puerto en los interruptores y los estadísticas de paquetes marcados ECN del adaptador utilizando ethtool -S o mlxlink.
  • Garantizar el SLO de latencia:Implementar monitoreo de latencia con marca de tiempo de hardware con herramientas como ucxtrace o mlx5cmd; RTT saludable típico inferior a 10 μs dentro del rack, inferior a 30 μs a través de las espinas.
  • Alineación del firmware y del controlador:Utilice el paquete de firmware validado de NVIDIA (consulteLas especificaciones de MCX631102AN-ADATpara los números exactos de piezas) y las versiones del conductor (mlx5_core ≥ 5,9).
  • RMA y gestión del ciclo de vida:Al analizarMCX631102AN-ADAT precioen comparación con el TCO, incluye un ciclo de actualización de nodos de 3-5 años; lista de múltiples distribuidores globalesMCX631102AN-ADAT para la ventacon soporte de garantía de varios años.

Para la resolución de problemas, las trampas más comunes son: umbrales de búfer de interruptor mal configurados (que conducen a tormentas de tramas de pausa), tipo de GID no coincidente (prefiero el tipo de GID 2 para IPv6 RoCEv2),y la falta de habilitación de descarga de hardware en los verbos de aplicación (asegurar ibv_reg_mr con acceso de escritura local).

6Resumen y evaluación del valor

ElNVIDIA Mellanox MCX631102AN-ADAT, también conocido como NVIDIA MellanoxOfrece una producción endurecidaSolución de tarjeta de adaptador Ethernet MCX631102AN-ADATpara organizaciones que buscan desbloquear un rendimiento de línea de baja latencia en una infraestructura 25GbE madura.la solución alcanza una latencia de NVMe-oF inferior a 20 microsegundos, recupera > 30% de los núcleos de la CPU para cargas de trabajo de aplicaciones, y mantiene un rendimiento agregado de 50Gbps con una eficiencia de paquetes pequeña que anteriormente solo se podía lograr en adaptadores de 100GbE.Para los arquitectos que planifican grupos de almacenamiento hiperconvergentes o de IA en campo verde, elSe aplicará el método de ensayo de la norma de la Nomenclatura de la Unión.Representa un facilitador estratégico que ofrece el perfil de latencia de InfiniBand con la simplicidad operativa de Ethernet.