Meta continúa liderando la industria en la utilización de innovadores sistemas de recomendación de IA (RecSys) para ofrecer mejores experiencias a las personas, y mejores resultados para los anunciantes. Para alcanzar la próxima frontera del rendimiento, Estamos ampliando los modelos de tiempo de ejecución del recomendador de anuncios de Meta a la escala LLM. & complejidad para promover una comprensión más profunda de los intereses y las intenciones de las personas.

Este aumento de escala & La complejidad exacerba un “trilema de inferencia” fundamental.: El desafío de equilibrar la mayor complejidad del modelo y la necesidad asociada de computación y memoria con la baja latencia y la rentabilidad requeridas para un servicio global que presta servicios a miles de millones de personas.. para superar esto, Hemos desarrollado el modelo de clasificación metaadaptativo., que dobla efectivamente la curva de escala de inferencia con un alto retorno de la inversión y una eficiencia líder en la industria.

El modelo de clasificación adaptativo reemplaza un enfoque de inferencia de “talla única” con inteligencia solicitar enrutamiento. Alineando dinámicamente la complejidad del modelo con una rica comprensión del contexto y la intención de una persona., El sistema garantiza que cada solicitud sea atendida por el personal más eficaz. & modelo eficiente. Esto permite que Meta Ads mantenga el estricto, Latencia inferior a un segundo de la que depende la plataforma y, al mismo tiempo, proporciona una experiencia de alta calidad para cada persona..

imagen[1]-Modelo de clasificación metaadaptativo: Doblar la curva de escala de inferencia para ofrecer modelos de escala LLM para anuncios para Windows 7,8,10,11-Winpcsoft.com Servir modelos de escala LLM a la escala de Meta requirió un replanteamiento fundamental de la pila de inferencia, impulsado por tres innovaciones clave:

  • Escalado de modelo eficiente en inferencia: Al cambiar a una arquitectura centrada en solicitudes, El modelo de clasificación adaptativo sirve para una escala LLM & modelo de complejidad con latencia inferior a un segundo, Permitir una comprensión más sofisticada de los intereses y las intenciones de una persona sin comprometer la experiencia..
  • Codiseño de modelo/sistema: Desarrollando arquitecturas de modelos compatibles con el hardware que alinean el diseño del modelo con el sistema de hardware subyacente y las capacidades y limitaciones del silicio., El modelo de clasificación adaptativo mejora significativamente la utilización del hardware en entornos de hardware heterogéneos.
  • Infraestructura de servicios reinventada: Aprovechando arquitecturas de múltiples tarjetas y optimizaciones específicas de hardware, El modelo de clasificación adaptativo habilita O(1t) escalado de parámetros, permitiéndonos servir los modelos RecSys en tiempo de ejecución a escala LLM con una eficiencia sin precedentes.

Integrando aún más la inteligencia a escala LLM en nuestra pila de anuncios, El modelo de clasificación adaptable ofrece un aumento significativo en las conversiones de anuncios y el valor del anunciante al tiempo que mantiene la eficiencia computacional en todo el sistema.. Esto garantiza un rendimiento superior para empresas de todos los tamaños.. Desde su lanzamiento en Instagram en el cuarto trimestre 2025, El modelo de clasificación adaptativo ha proporcionado una +3% aumento de las conversiones de anuncios y +5% aumento en la tasa de clics en anuncios para usuarios específicos.

Presentamos el modelo de clasificación metaadaptativo

Sirviendo a escala LLM & Los modelos de complejidad en un entorno de recomendación de anuncios en tiempo real requieren resolver una tensión fundamental entre la complejidad del modelo y la eficiencia del sistema.. A diferencia de las aplicaciones LLM como los chatbots, donde los tiempos de respuesta se miden en segundos, una recomendación de anuncio debe cumplir dos restricciones inflexibles:

  1. La latencia afecta la experiencia del usuario: Los anuncios deben elegirse y devolverse con una latencia inferior a un segundo.. Tradicionalmente, escalar el cálculo de anuncios al nivel de escala LLM y más allá ha sido imposible sin regresiones de latencia que comprometen la experiencia del usuario..
  2. La rentabilidad es crucial: El escalamiento por fuerza bruta simplemente agregando hardware es económicamente insostenible. Lograr un retorno de la inversión positivo requiere desbloquear una mayor complejidad del modelo sin el correspondiente aumento en los costos totales..

El modelo de clasificación adaptable aborda estos desafíos a través de un cambio de paradigma impulsado por tres innovaciones centrales en toda la pila de servicios.:

  • Escalado de modelo eficiente en inferencia: Modelo de clasificación adaptativo logra una complejidad del modelo equivalente a la O(10 GFLOP) por token utilizado por LLM de primer nivel. Sin embargo, opera un orden de magnitud más rápido que la inferencia LLM estándar, manteniendo oh(100 EM) latencia limitada.
  • Codiseño profundo de modelo-sistema: El modelo de clasificación adaptativa está profundamente codiseñado con el hardware y el silicio subyacentes.; Hemos impulsado la utilización de los modelos FLOP. (PÉRDIDA) a 35% en múltiples tipos de hardware.
  • Infraestructura de servicio reinventada: El modelo de clasificación adaptable utiliza una infraestructura de servicio de GPU de múltiples tarjetas para romper los límites de memoria física de dispositivos individuales.. Esto nos permite escalar los parámetros del modelo para oh(1t), providing a depth of understanding of people’s interests and intent previously impossible at Meta’s scale.

Al unificar estas innovaciones, Nos aseguramos de que se utilice el modelo más eficaz para cada solicitud, brindando una experiencia publicitaria altamente personalizada para las personas en nuestras plataformas y maximizando el valor del anunciante mientras mantenemos la eficiencia computacional en todo el sistema..

imagen[2]-Modelo de clasificación metaadaptativo: Doblar la curva de escala de inferencia para ofrecer modelos de escala LLM para anuncios para Windows 7,8,10,11-Winpcsoft.com

Escalado de modelo eficiente en inferencia

El modelo de clasificación adaptativo introduce innovaciones en el sistema de modelos que redefinen fundamentalmente la eficiencia de la inferencia. Esta transformación se basa en tres pilares técnicos:

  • Transformar los costos de escalamiento de lineales a sublineales cambiando a un flujo de cálculo orientado a solicitudes que elimina la redundancia masiva a escala LLM.
  • Maximizar el rendimiento estructural a través de mejoras arquitectónicas que estabilizan los modelos profundos y minimizan los cuellos de botella de la red interna.
  • Neutralizar la sobrecarga de complejidad mediante la optimización integral de la latencia, descargar el preprocesamiento de funciones a las GPU y optimizar la ruta de ejecución de un extremo a otro.

Transformar los costos de escalamiento de lineales a sublineales

Los modelos tradicionales procesan cada par de anuncios-usuario de forma independiente, creando una redundancia computacional masiva. El modelo de clasificación adaptativo elimina esto mediante la optimización orientada a solicitudes, que calcula señales de usuario de alta densidad una vez por solicitud en lugar de una vez por candidato de anuncio. este cambio, impulsado por computación compartida orientada a solicitudes y optimización de transmisión en el kernel, que comparte incrustaciones a nivel de solicitud entre candidatos de anuncios directamente dentro del kernel de GPU, transforma los costos de escalado de lineales a sublineales al tiempo que reduce significativamente la presión del ancho de banda de la memoria.

Construyendo sobre esto, El escalado de secuencias orientado a solicitudes desbloquea el uso de secuencias de comportamiento de usuario de formato largo que antes estaban limitadas por los costos de computación y almacenamiento.. Para minimizar la sobrecarga informática, El modelo de clasificación adaptable procesa secuencias pesadas una vez por solicitud y comparte los resultados entre todos los anuncios candidatos.. Para optimizar el almacenamiento, reemplaza la replicación de datos redundante con una centralizada, almacén de valores clave de alta eficiencia de registros de usuario que se unen con datos de entrenamiento sobre la marcha. Estas optimizaciones minimizan conjuntamente las huellas de servicio y almacenamiento necesarias para los sistemas a escala global..

Maximizando el rendimiento estructural con Wukong Turbo

Mientras Optimización orientada a solicitudes optimiza el flujo de cálculo, Wukong Turbo es la evolución optimizada del tiempo de ejecución de la arquitectura interna de Meta Ads. Construyendo sobre el arquitectura de wukong que utiliza máquinas de factorización apilables, Aprendizaje secuencial y atención entre capas., Wukong Turbo introduce mejoras específicas para manejar la inestabilidad numérica y la sobrecarga de la red que normalmente surgen al escalar modelos profundos.. Específicamente, emplea un enfoque sin prejuicios para eliminar términos inestables, aumentar el rendimiento sin aumentar los FLOP o el recuento de parámetros. Para evitar cuellos de botella internos, utiliza una pequeña delegación de parámetros para reducir la sobrecarga de la red y la memoria mediante la descarga de parámetros de datos paralelos totalmente fragmentados. (FSDP) a datos distribuidos en paralelo (DDP) junto con una simplificación basada en la escasez que reduce los componentes redundantes en las capas lineales. Estas mejoras transforman la arquitectura base en una estable., sistema de alto rendimiento, Permitir que la complejidad del modelo aumente mientras se protege estrictamente el presupuesto de inferencia de menos de un segundo..

Neutralización de los gastos generales de complejidad mediante la optimización integral de la latencia

La etapa final de esta transformación aborda el preprocesamiento de características, un cuello de botella tradicional. lo que genera presión en la memoria del cliente y escasez de datos, donde la potencia de cálculo de la GPU permanece infrautilizada mientras se espera las funciones procesadas.. El modelo de clasificación adaptable descarga el preprocesamiento desde la CPU del cliente a hosts de GPU remotos, utilizando formatos compactos basados ​​en tuplas y núcleos nativos de GPU que reducen la complejidad de Top-K de oh(norte registro norte) a oh(norte). Para acelerar aún más el procesamiento, Implementamos una estrategia holística de compresión de datos optimizada y reestructuración del flujo de clientes para eliminar la contención del grupo de subprocesos.. Estas optimizaciones de múltiples capas neutralizaron con éxito la penalización de latencia de la escala LLM & complejidad, permitiendo que el modelo de clasificación adaptable ofrezca personalización a nivel de frontera a la velocidad que requieren las plataformas globales de Meta.

Maximizar la eficiencia a través del código profundo del sistema-modelo

Meta Ads se basa en una profunda cooptimización del sistema para permitir la complejidad del modelo de escala LLM dentro de las limitaciones de rendimiento de metaescala.. Repensando fundamentalmente el límite entre el modelo y el hardware., Hemos creado una pila de inferencia unificada que optimiza la precisión computacional y la ejecución de gráficos para maximizar el retorno de la inversión computacional al impulsar la utilización de los FLOP del modelo. (PÉRDIDA) en hardware heterogéneo.

Inferencia de alto rendimiento con cuantificación selectiva del 8PM

Los modelos a gran escala requieren una precisión reducida para mantener una inferencia de alto rendimiento, sin embargo, una aplicación general de cuantificación de baja precisión a menudo degrada los matices necesarios para la clasificación de anuncios complejos.. El modelo de clasificación adaptativo supera esto mediante una estrategia de cuantificación posterior al entrenamiento que aplica el FP8 de forma selectiva. Utilizando un mecanismo de selección guiada de micro-benchmark, el sistema implementa FP8 solo en capas con alta tolerancia a la pérdida de precisión. Este enfoque específico desbloquea los beneficios de rendimiento del hardware heterogéneo moderno para nuestros modelos más complejos con un impacto insignificante en la calidad de las recomendaciones..

Especialización en kernel y gráficos con reconocimiento de hardware

Para minimizar la latencia causada por el acceso redundante a la memoria y los lanzamientos ineficientes del kernel., El modelo de clasificación adaptativo optimiza el flujo de ejecución a través de gráficos coordinados y especialización del kernel.. Fusionamos operadores que comparten entradas para minimizar el movimiento de datos entre la memoria de gran ancho de banda y la SRAM en el chip.. Además, Miles de pequeñas operaciones se consolidan en núcleos densos en computación utilizando técnicas como la multiplicación de matrices generales agrupadas y la fusión horizontal.. Esta alineación precisa entre el gráfico de cálculo y las arquitecturas GPU modernas reduce significativamente la huella de memoria y aumenta la utilización efectiva del hardware., Garantizar que la complejidad del modelo a escala LLM se traduzca directamente en rendimiento..

Infraestructura de servicios reinventada para la realidad de la producción a escala LLM

Más allá de la cooptimización del modelo-sistema, La implementación de modelos LLM a escala requiere reinventar la infraestructura de servicio subyacente.. Neutralizar la penalización de latencia a gran escala, El modelo de clasificación adaptativa utiliza una pila especializada diseñada para superar los límites de la memoria física y garantizar la confiabilidad de la producción a metaescala..

Escala de parámetros de billones

A diferencia de los LLM estándar, Los modelos de recomendación están impulsados ​​por predominantemente escasos., características categóricas. La asignación de estos ID a tablas de incrustación de alta dimensión crea una compensación crítica en la que las tablas de gran tamaño conducen a un sobreajuste., mientras que las tablas de tamaño insuficiente sufren colisiones hash que degradan la calidad del modelo. El modelo de clasificación adaptativo habilita O(1t) Escala de parámetros a través de optimizaciones de memoria que resuelven esta tensión.. El sistema asigna de manera eficiente tamaños de hash incrustados en función de la escasez de funciones y elimina las incrustaciones no utilizadas para maximizar la capacidad de aprendizaje dentro de presupuestos de memoria estrictos.. Esto se optimiza aún más mediante incorporaciones unificadas., que permiten que múltiples funciones compartan una única tabla de incrustación para reducir significativamente la huella de memoria sin sacrificar la capacidad de aprender interacciones de funciones complejas..

Escalado de incrustación de múltiples tarjetas GPU

A medida que las incorporaciones de modelos a escala LLM se acercaban al nivel de terabytes, excedieron la capacidad de memoria de cualquier GPU. Para mitigar esto, un mecanismo de fragmentación de múltiples tarjetas divide las tablas de incrustación en segmentos distribuidos en un clúster de hardware optimizado. Aprovechando las optimizaciones de comunicación específicas del hardware, el sistema mantiene un alto rendimiento y una comunicación eficiente entre fragmentos. Esta arquitectura de múltiples tarjetas logra paridad de rendimiento con configuraciones de una sola tarjeta., desacoplar eficazmente la complejidad del modelo de las limitaciones de hardware de GPU individuales.

Resiliencia y confiabilidad en tiempo de ejecución

Servir modelos de billones de parámetros en condiciones de mucho tráfico presenta importantes desafíos de confiabilidad, particularmente en lo que respecta a la velocidad de inicialización y la estabilidad del sistema. Para garantizar la confiabilidad a nivel de producción, Desarrollamos la carga acelerada de modelos que utiliza descargas de múltiples flujos y almacenamiento en caché remoto para cargar modelos en menos tiempo. 10 minutos, Minimizar el tiempo de inactividad durante las implementaciones.. Las reglas de escalado automático basadas en la utilización de multiprocesador de transmisión permiten que el sistema maneje el tráfico fluctuante de forma dinámica.. Esto garantiza que se satisfaga la demanda en tiempo real sin la necesidad de un exceso de aprovisionamiento innecesario., manteniendo la estabilidad en toda la plataforma.

El camino a seguir: Evolución de la pila de modelos de clasificación adaptativa

El lanzamiento del modelo de clasificación adaptativa en Instagram marca el primer hito en nuestro viaje para doblar la curva de escalamiento de inferencia entre rendimiento y costos a metaescala.. La hoja de ruta pasa de optimizaciones individuales a una infraestructura cada vez más autónoma y receptiva a en tiempo real fluctuaciones en la densidad de la señal del usuario y patrones de solicitud en nuestro ecosistema global.

Esta visión comenzó con la evolución del escalamiento eficiente de la inferencia para desbloquear una complejidad más profunda y secuencias de comportamiento más largas que capturan la intención del usuario con una fidelidad sin precedentes.. Para sostener este crecimiento, somos pioneros en una nueva era de eficiencia en la ejecución de inferencias, Aprovechar la compresión avanzada de modelos y los métodos de cuantificación de precisión ultrabaja para permitir que los modelos de escala LLM más sofisticados se ejecuten de manera eficiente en una flota de hardware global diversa..

Eliminar los tradicionales cuellos de botella de la ingeniería manual., Estamos explorando marcos de optimización agentes para acelerar aún más las optimizaciones del rendimiento del kernel.. Estos marcos se adaptarán automáticamente a nuevas arquitecturas de hardware y modelos., Garantizar que la IA más sofisticada siga siendo accesible y funcionando a escala..

Además, Estamos reinventando la velocidad del aprendizaje a través de una actualización del modelo casi instantánea., utilizando incremental, actualizaciones de peso in situ para lograr una constante, adaptación en tiempo real. Colectivamente, Estas innovaciones garantizarán que el modelo de clasificación adaptativa siga impulsando experiencias más personales para las personas y, al mismo tiempo, impulse un ROAS superior para los anunciantes de todo el mundo..

Expresiones de gratitud

Nos gustaría agradecer: Jia Jiun Ang, Pan Chen, Wenlin Chen, Maomao Ding, Fanático de Chengze, Lu Fang, Guan de Birmingham, Qin Huang, Santanu Kolay, Ashwin Kumar, Jinfu Leng, Boda Li, Huayu Li, Jia Wei Li, Li-Li (Clasificación de anuncios), Li Yuan Li, Mingda Li, Wen Yuan Li, rocoso liu, Jason Lu, Roberto Luo, Yinbin Ma, Sandeep Pandey, Uladzimir Pashkevich, Varna Puvvada, michael shao, Pranav Sharma, Shen Zijian, Vibha Sinha, Matt Steiner, Sol de Chonglin, Sol de Weiman, Aarón (Libo) tao, Xiao Han Wei, Natan Yan, Yantao Yao, Hongtao Yu, Li Yu, Sihan Zeng, Buyun Zhang, Bill Zhao, Alex Zhong, Zhehui Zhou, ay todo equipo V Equipo detrás del desarrollo y producción del modelo de tiempo de ejecución a escala LLM en el sistema de recomendación de anuncios de Meta..