NVIDIA Mellanox MCX631102AN-ADAT en Acción: Transporte de baja latencia RDMA/RoCE y optimización del rendimiento del servidor

July 27, 2026

últimas noticias de la compañía sobre NVIDIA Mellanox MCX631102AN-ADAT en Acción: Transporte de baja latencia RDMA/RoCE y optimización del rendimiento del servidor

NVIDIA Mellanox MCX631102AN-ADAT en acción: RDMA / RoCE transporte de baja latencia y optimización del rendimiento del servidor

Antecedentes y desafíos: el cuello de botella de latencia y rendimiento en el almacenamiento distribuido

Un proveedor de servicios de nube de tamaño mediano que opera un clúster de almacenamiento Ceph distribuido en 120 servidores x86 comenzó a experimentar problemas de rendimiento crecientes.basándose en TCP/IP para la comunicación entre nodosLos síntomas clave incluyeron una alta utilización de la CPU superior al 45% en los nodos de almacenamiento debido al procesamiento del protocolo de red,Las tardanzas promedio de lectura/escritura superan los 3 milisegundos durante las horas pico, y una brecha significativa entre el rendimiento teórico del disco y el rendimiento real entregado por la red.El equipo de ingenieros reconoció que lograr una latencia de menos de un milisegundo y liberar plenamente el rendimiento NVMe requería un cambio fundamental en el enfoque de la red., la adopción de RDMA a través de Ethernet convergente (RoCE).

Solución y implementación: introducción de la solución de tarjeta de adaptador Ethernet MCX631102AN-ADAT

Después de evaluar varias opciones de proveedores, el equipo seleccionó elNVIDIA Mellanox MCX631102AN-ADAT, también conocido como NVIDIA MellanoxLa red de servicios de telecomunicaciones de los Estados miembros se ha convertido en el principal facilitador de la actualización de su red.Se utilizará para la fabricación de las máquinas de la categoría M3El adaptador fue elegido por su soporte nativo de RoCEv2, control de congestión basado en hardware e integración perfecta con su infraestructura de cableado SFP28 existente.

La estrategia de despliegue se ha dividido en tres grupos:

  • Fase 1 (piloto):16 nodos de almacenamiento fueron equipados con elTarjeta de adaptador Ethernet MCX631102AN-ADATLos adaptadores fueron configurados en modo activo-activo de doble puerto, con cada puerto conectado a un par de switches NVIDIA Spectrum para redundancia.
  • Fase 2 (optimización):RoCEv2 fue habilitado con Control de Flujo de Prioridad (PFC) y Notificación de Congestión Explicita (ECN) afinados para evitar caídas de red.El equipo aprovechó los motores de descarga de hardware del adaptador para NVMe-oF y cálculos de codificación de borrado.
  • Fase 3 (despliegue completo):Todos los 120 nodos fueron migrados a laNVIDIA Mellanox MCX631102AN-ADAT, también conocido como NVIDIA Mellanox, con la pila de red Ceph OSD (Object Storage Daemon) reconfigurada para usar el transporte RDMA.

De acuerdo con elSe aplicarán las siguientes medidas:, la interfaz PCIe 4.0 x8 del adaptador proporciona un ancho de banda suficiente para manejar un rendimiento agregado de 50 Gb/s.Las especificaciones de MCX631102AN-ADATEl adaptador también demostró ser compatible con los requisitos de rendimiento más estrictos.Compatible con el MCX631102AN-ADATcon sus distribuciones Linux existentes (RHEL 9.2) y controladores Mellanox OFED, simplificando significativamente el proceso de implementación.

Resultados y beneficios: ganancias medibles en latencia y rendimiento

El impacto de la migración fue inmediatamente evidente en las métricas de producción.

El método métrico Pre-actualización (10GbE TCP/IP) Se aplicará el método de evaluación de la calidad de los productos. Mejora
Tensión media de lectura 2.8 ms 0.4 ms Reducción de 7×
La latencia media de escritura 3.2 ms 0.5 ms 6.4 veces la reducción
Utilización de la CPU del nodo (pila de red) El 42% El 11% 31 pp liberados
Producción agregada de grupos 18 Gb/s 42 Gb/s 2.3 veces el aumento

Además de las cifras, el equipo observó mejoras operacionales significativas.Se aplicará el método de ensayo de la norma de la Nomenclatura de la Unión.permitió una migración en vivo sin problemas de las máquinas virtuales que ejecutan aplicaciones sensibles a la latencia, ya que el jitter de la red disminuyó a niveles insignificantes.La descarga NVMe-oF basada en hardware redujo la latencia de acceso al almacenamiento en un 30% adicional, lo que permite al clúster manejar cargas de trabajo mixtas de lectura/escritura con tiempos de respuesta consistentes de menos de un milisegundo.MCX631102AN-ADAT precioEl proveedor también señaló que el aumento de rendimiento de 2,3 veces y la capacidad de aplazar las compras de servidores adicionales por al menos 18 meses.MCX631102AN-ADAT para la ventaLas opciones a través de los socios de canal ofrecieron descuentos flexibles por volumen para las implementaciones a gran escala.

Además, las capacidades integradas del adaptador para la telemetría y la gestión fuera de banda se detallan en elSe aplicarán las siguientes medidas:¢ proporcionó una visibilidad profunda del estado de la red, lo que permite una gestión proactiva de la congestión y un análisis más rápido de la causa raíz durante la resolución de incidentes.

Resumen y perspectivas: Una base estratégica para las cargas de trabajo futuras

Este despliegue en el mundo real demuestra que elNVIDIA Mellanox MCX631102AN-ADAT, también conocido como NVIDIA Mellanoxes mucho más que una simple actualización de ancho de banda.Solución de tarjeta de adaptador Ethernet MCX631102AN-ADATpara entornos habilitados para RoCE, elimina efectivamente la red como un cuello de botella de rendimiento, liberando todo el potencial de las arquitecturas de almacenamiento y CPU NVMe modernas.La combinación de doble puerto 25GbE, descargas RDMA integrales y una amplia compatibilidad del ecosistema posicionan este adaptador como una inversión estratégica para cualquier organización que planee escalar tuberías de IA / ML, bases de datos distribuidas,o infraestructuras hiperconvergentes.

Mirando hacia el futuro, el equipo está explorando casos de uso extendidos, incluyendo la integración de NVIDIA DOCA para rutas de datos programables y el aprovisionamiento de contacto cero.Aumentar el rendimiento, y recuperar los recursos de la CPU, elSe aplicará el método de ensayo de la norma de la Nomenclatura de la Unión.establece un nuevo punto de referencia para los adaptadores de servidores 25GbE en entornos empresariales y en la nube.