Meta continue de dominer le secteur en utilisant des systèmes de recommandation d'IA révolutionnaires (SysRec) pour offrir de meilleures expériences aux gens, et de meilleurs résultats pour les annonceurs. Pour atteindre la prochaine frontière de la performance, nous adaptons les modèles d'exécution de Meta's Ads Recommender à l'échelle LLM & complexité pour approfondir une compréhension plus profonde des intérêts et des intentions des gens.
Cette augmentation d'échelle & la complexité exacerbe un « trilemme d’inférence » fondamental: le défi consistant à équilibrer la complexité accrue des modèles et les besoins associés en matière de calcul et de mémoire avec la faible latence et la rentabilité requises pour un service mondial au service de milliards de personnes. Pour surmonter cela, nous avons développé le modèle de classement méta adaptatif, qui courbe efficacement la courbe de mise à l'échelle d'inférence avec un retour sur investissement élevé et une efficacité de pointe.
Le modèle de classement adaptatif remplace une approche d'inférence « taille unique » par des routage des demandes. En alignant dynamiquement la complexité du modèle avec une riche compréhension du contexte et de l’intention d’une personne, le système garantit que chaque demande est traitée par le service le plus efficace & modèle efficace. Cela permet aux Meta Ads de maintenir le strict, latence inférieure à la seconde dont dépend la plate-forme tout en offrant une expérience de haute qualité à chaque personne.
Servir des modèles à l'échelle LLM à l'échelle de Meta a nécessité une refonte fondamentale de la pile d'inférence, porté par trois innovations clés:
- Mise à l'échelle du modèle efficace par inférence: En passant à une architecture centrée sur les requêtes, Le modèle de classement adaptatif sert une échelle LLM & modèle de complexité avec une latence inférieure à la seconde, permettre une compréhension plus sophistiquée des intérêts et des intentions d’une personne sans compromettre l’expérience.
- Co-conception modèle/système: En développant des architectures de modèles sensibles au matériel qui alignent la conception des modèles sur le système matériel sous-jacent et les capacités et limites du silicium., Le modèle de classement adaptatif améliore considérablement l'utilisation du matériel dans des environnements matériels hétérogènes.
- Infrastructure de service réinventée: Tirer parti des architectures multi-cartes et des optimisations spécifiques au matériel, Le modèle de classement adaptatif permet à O(1T) mise à l'échelle des paramètres, nous permettant de servir les modèles RecSys d'exécution à l'échelle LLM avec une efficacité sans précédent.
En intégrant davantage l'intelligence à l'échelle LLM dans notre pile publicitaire, Le modèle de classement adaptatif offre une augmentation significative des conversions publicitaires et de la valeur pour l'annonceur tout en maintenant l'efficacité informatique à l'échelle du système.. Cela garantit des performances supérieures pour les entreprises de toutes tailles. Depuis le lancement sur Instagram au quatrième trimestre 2025, Le modèle de classement adaptatif a fourni un +3% augmentation des conversions publicitaires et +5% augmentation du taux de clics sur les annonces pour les utilisateurs ciblés.
Présentation du modèle de classement méta-adaptatif
Servir à l'échelle LLM & Les modèles de complexité dans un environnement de recommandation de publicités en temps réel nécessitent de résoudre une tension fondamentale entre la complexité du modèle et l'efficacité du système.. Contrairement aux applications LLM telles que les chatbots, où les temps de réponse sont mesurés en secondes, une recommandation publicitaire doit répondre à deux contraintes sans compromis:
- La latence a un impact sur l'expérience utilisateur: Les annonces doivent être choisies et renvoyées avec une latence inférieure à la seconde. La mise à l'échelle du calcul des publicités au niveau LLM et au-delà est traditionnellement impossible sans régressions de latence qui compromettent l'expérience utilisateur..
- La rentabilité est cruciale: La mise à l'échelle de la force brute par simple ajout de matériel n'est pas économiquement viable. Pour obtenir un retour sur investissement positif, il faut débloquer une plus grande complexité de modèle sans augmentation correspondante des coûts totaux..
Le modèle de classement adaptatif répond à ces défis grâce à un changement de paradigme alimenté par trois innovations fondamentales à travers la pile de services.:
- Mise à l'échelle du modèle efficace pour l'inférence: Modèle de classement adaptatif atteint une complexité de modèle équivalente à celle de O(10 GFLOP) par jeton utilisé par les LLM de premier plan. Cependant, il fonctionne un ordre de grandeur plus rapide que l'inférence LLM standard, maintenir Ô(100 MS) latence limitée.
- Co-conception approfondie modèle-système: Le modèle de classement adaptatif est profondément co-conçu avec le matériel et le silicium sous-jacents; nous avons stimulé l'utilisation des modèles FLOP (PERTE) à 35% sur plusieurs types de matériel.
- Une infrastructure de service réinventée: Le modèle de classement adaptatif utilise une infrastructure de service GPU multi-cartes pour dépasser les limites de mémoire physique d'appareils uniques.. Cela nous permet d'adapter les paramètres du modèle à Ô(1T), providing a depth of understanding of people’s interests and intent previously impossible at Meta’s scale.
En unifiant ces innovations, nous veillons à ce que le modèle le plus efficace soit utilisé pour chaque demande, en offrant une expérience publicitaire hautement personnalisée aux utilisateurs de nos plateformes et en maximisant la valeur de l'annonceur tout en maintenant l'efficacité informatique à l'échelle du système..
![image[2]-Modèle de classement méta-adaptatif: Plier la courbe de mise à l'échelle d'inférence pour servir des modèles à l'échelle LLM pour les publicités pour Windows 7,8,10,11-Winpcsoft.com](https://winpcsoft.com/wp-content/plugins/wp-fastest-cache-premium/pro/images/blank.gif)
Mise à l'échelle du modèle efficace par inférence
Le modèle de classement adaptatif introduit des innovations de modèle-système qui redéfinissent fondamentalement l'efficacité de l'inférence. Cette transformation repose sur trois piliers techniques:
- Transformer les coûts de mise à l'échelle de linéaires en sous-linéaires en passant à un flux de calcul orienté requête qui élimine la redondance massive à l'échelle LLM.
- Maximiser le débit structurel grâce à des améliorations architecturales qui stabilisent les modèles profonds et minimisent les goulots d'étranglement du réseau interne.
- Neutralisation de la complexité grâce à une optimisation globale de la latence, décharger le prétraitement des fonctionnalités sur les GPU et rationaliser le chemin d'exécution de bout en bout.
Transformer les coûts de mise à l'échelle de linéaires en sous-linéaires
Les modèles traditionnels traitent chaque paire utilisateur-annonce indépendamment, créer une redondance informatique massive. Le modèle de classement adaptatif élimine cela grâce à l'optimisation orientée demande, qui calcule les signaux utilisateur haute densité une fois par requête plutôt qu'une fois par annonce candidate. Ce changement, optimisé par le partage de calcul orienté requête et l'optimisation de la diffusion dans le noyau, qui partage les intégrations au niveau des requêtes entre les candidats publicitaires directement dans le noyau GPU, transforme les coûts de mise à l'échelle de linéaire en sous-linéaire tout en réduisant considérablement la pression sur la bande passante mémoire.
S'appuyant sur cela, La mise à l'échelle des séquences orientée requêtes permet d'utiliser des séquences de comportement utilisateur longues qui étaient auparavant limitées par les coûts de calcul et de stockage.. Pour minimiser la surcharge de calcul, Le modèle de classement adaptatif traite les séquences lourdes une fois par demande et partage les résultats entre tous les candidats publicitaires.. Pour optimiser le stockage, il remplace la réplication redondante des données par une, stockage de valeurs-clés à haute efficacité de journaux d'utilisateurs qui sont joints aux données d'entraînement à la volée. Ces optimisations minimisent conjointement les empreintes de service et de stockage requises pour les systèmes à l'échelle mondiale..
Maximiser le débit structurel avec Wukong Turbo
Alors que Optimisation orientée demande optimise le flux de calcul, Wukong Turbo est l'évolution d'exécution optimisée de l'architecture interne de Meta Ads. S'appuyant sur le Architecture de Wukong qui utilise des machines de factorisation empilables, apprentissage séquentiel et attention multicouche, Wukong Turbo introduit des améliorations spécifiques pour gérer l'instabilité numérique et la surcharge du réseau qui surviennent généralement lors de la mise à l'échelle de modèles approfondis.. Spécifiquement, il utilise une approche sans biais pour supprimer les termes instables, augmenter le débit sans augmenter les FLOP ou le nombre de paramètres. Pour éviter les goulots d’étranglement internes, il utilise une petite délégation de paramètres pour réduire la surcharge du réseau et de la mémoire en déchargeant les paramètres de Fully Sharded Data Parallel (PDSF) aux données distribuées en parallèle (DDP) aux côtés d'une simplification basée sur la parcimonie qui réduit les composants redondants dans les couches linéaires. Ces améliorations transforment l'architecture de base en une architecture stable, système performant, permettre à la complexité du modèle d'évoluer tout en protégeant strictement le budget d'inférence inférieur à la seconde.
Neutralisation des frais généraux de complexité grâce à une optimisation holistique de la latence
La dernière étape de cette transformation concerne le prétraitement des fonctionnalités, un goulot d'étranglement traditionnel. conduisant à une pression sur la mémoire client et à une pénurie de données où la puissance de calcul du GPU reste sous-utilisée en attendant les fonctionnalités traitées. Le modèle de classement adaptatif décharge le prétraitement du processeur client vers les hôtes GPU distants., utilisant des formats compacts basés sur des tuples et des noyaux GPU natifs qui réduisent la complexité Top-K de Ô(N log N) à Ô(N). Pour accélérer encore le traitement, nous avons mis en œuvre une stratégie globale de compression optimisée des données et de restructuration des flux clients pour éliminer les conflits entre les pools de threads. Ces optimisations multicouches ont réussi à neutraliser la pénalité de latence des systèmes à l'échelle LLM. & complexité, permettant au modèle de classement adaptatif d'offrir une personnalisation de premier plan à la vitesse requise par les plates-formes mondiales de Meta.
Maximiser l'efficacité grâce à une conception approfondie du modèle et du système
Meta Ads s'appuie sur une co-optimisation approfondie du système pour permettre la complexité du modèle à l'échelle LLM dans le cadre des contraintes de performances à l'échelle méta.. En repensant fondamentalement la frontière entre le modèle et le matériel, nous avons créé une pile d'inférence unifiée qui optimise la précision des calculs et l'exécution des graphiques afin de maximiser le retour sur investissement des calculs en améliorant l'utilisation des modèles FLOP. (PERTE) sur du matériel hétérogène.
Inférence à haut débit avec quantification sélective FP8
Les modèles à grande échelle nécessitent une précision réduite pour maintenir une inférence à haut débit, Pourtant, une application généralisée de quantification de faible précision dégrade souvent les nuances requises pour un classement complexe des annonces.. Le modèle de classement adaptatif surmonte ce problème grâce à une stratégie de quantification post-formation qui applique sélectivement le FP8.. Utiliser un mécanisme de sélection guidée par micro-benchmark, le système déploie FP8 uniquement dans des couches avec une tolérance de perte de précision élevée. Cette approche ciblée libère les avantages en termes de débit du matériel hétérogène moderne pour nos modèles les plus complexes avec un impact négligeable sur la qualité des recommandations..
Spécialisation en graphiques et noyau sensibles au matériel
Pour minimiser la latence causée par un accès mémoire redondant et des lancements de noyau inefficaces, Le modèle de classement adaptatif optimise le flux d'exécution grâce à une spécialisation coordonnée des graphiques et du noyau. Nous fusionnons les opérateurs qui partagent des entrées pour minimiser le mouvement des données entre la mémoire à large bande passante et la SRAM sur puce.. En plus, des milliers de petites opérations sont consolidées dans des noyaux denses en calcul à l'aide de techniques telles que la multiplication matricielle générale groupée et la fusion horizontale. Cet alignement précis entre le graphique de calcul et les architectures GPU modernes réduit considérablement l'empreinte mémoire et augmente l'utilisation efficace du matériel., s'assurer que la complexité du modèle à l'échelle LLM se traduit directement en performances.
Une infrastructure de service réinventée pour la réalité de la production à l'échelle LLM
Au-delà de la co-optimisation modèle-système, le déploiement de modèles à l'échelle LLM nécessite de réimaginer l'infrastructure de service sous-jacente. Pour neutraliser la pénalité de latence à grande échelle, le modèle de classement adaptatif utilise une pile spécialisée conçue pour dépasser les limites de mémoire physique et garantir la fiabilité de la production à l'échelle méta..
Échelle de paramètres en milliards
Contrairement aux LLM standards, les modèles de recommandation reposent principalement sur des données clairsemées, caractéristiques catégorielles. Le mappage de ces identifiants sur des tables d'intégration de grande dimension crée un compromis critique dans lequel des tables surdimensionnées conduisent à un surajustement., tandis que les tables sous-dimensionnées souffrent de collisions de hachage qui dégradent la qualité du modèle. Le modèle de classement adaptatif permet à O(1T) échelle des paramètres grâce à des optimisations de mémoire qui résolvent cette tension. Le système alloue efficacement les tailles de hachage d'intégration en fonction de la rareté des fonctionnalités et élague les intégrations inutilisées pour maximiser la capacité d'apprentissage dans le cadre de budgets de mémoire stricts.. Ceci est encore optimisé par des intégrations unifiées, qui permettent à plusieurs fonctionnalités de partager une seule table d'intégration afin de réduire considérablement l'empreinte mémoire sans sacrifier la capacité d'apprendre des interactions de fonctionnalités complexes.
Mise à l'échelle de l'intégration de cartes multi-GPU
Alors que les intégrations de modèles à l'échelle LLM approchaient du niveau du téraoctet, ils ont dépassé la capacité de mémoire de n'importe quel GPU. Pour atténuer cela, un mécanisme de partitionnement multi-cartes divise les tables d'intégration en segments répartis sur un cluster matériel optimisé. En tirant parti des optimisations de communication spécifiques au matériel, le système maintient un débit élevé et une communication efficace entre les fragments. Cette architecture multicarte atteint la parité des performances avec les configurations à carte unique, dissocier efficacement la complexité du modèle des contraintes matérielles individuelles des GPU.
Résilience et fiabilité d'exécution
La gestion de modèles comportant des milliers de milliards de paramètres dans des conditions de trafic élevé présente d'importants défis en matière de fiabilité., en particulier en ce qui concerne la vitesse d'initialisation et la stabilité du système. Pour garantir une fiabilité de niveau production, nous avons développé un chargement accéléré de modèles qui utilise le téléchargement multi-flux et la mise en cache à distance pour charger des modèles sous 10 minutes, minimiser les temps d'arrêt pendant les déploiements. Les règles de mise à l'échelle automatique basées sur l'utilisation du multiprocesseur de streaming permettent au système de gérer dynamiquement le trafic fluctuant.. Cela garantit que la demande en temps réel est satisfaite sans avoir recours à un surprovisionnement inutile., maintenir la stabilité sur toute la plateforme.
La voie à suivre: Faire évoluer la pile de modèles de classement adaptatif
Le lancement du modèle de classement adaptatif sur Instagram marque la première étape de notre parcours visant à réduire la courbe d'échelle des performances d'inférence par rapport aux coûts à l'échelle méta.. La feuille de route passe des optimisations individuelles à une infrastructure de plus en plus autonome et réactive aux en temps réel fluctuations de la densité du signal utilisateur et des modèles de requêtes dans notre écosystème mondial.
Cette vision a commencé avec une mise à l'échelle efficace de l'inférence pour débloquer une complexité plus profonde et des séquences comportementales plus longues qui capturent l'intention de l'utilisateur avec une fidélité sans précédent.. Pour pérenniser cette croissance, nous sommes pionniers dans une nouvelle ère d'efficacité d'exécution des inférences, tirer parti des méthodes avancées de compression de modèles et de quantification de très faible précision pour permettre aux modèles à l'échelle LLM les plus sophistiqués de fonctionner efficacement sur une flotte matérielle mondiale diversifiée.
Éliminer les goulots d’étranglement traditionnels de l’ingénierie manuelle, nous explorons des cadres d'optimisation agentiques pour accélérer davantage les optimisations des performances du noyau. Ces frameworks s'adapteront automatiquement aux nouvelles architectures matérielles et modèles, garantir que l’IA la plus sophistiquée reste accessible et performante à grande échelle.
En outre, nous réinventons la vitesse d'apprentissage grâce à une fraîcheur de modèle quasi instantanée, en utilisant incrémentiel, mises à jour de poids sur place pour obtenir une constante, adaptation en temps réel. Collectivement, ces innovations garantiront que le modèle de classement adaptatif continue de proposer des expériences plus personnelles aux utilisateurs tout en générant un ROAS supérieur pour les annonceurs du monde entier..
Remerciements
Nous tenons à remercier: Jia Jiunn Ang, Pan Chen, Wenlin Chen, Maomao Ding, Fan de Chengze, Lu Fang, Guan de Birmingham, Qin Huang, Santanu Kolay, Ashwin Kumar, Jinfu Leng, Boda-Li, Hua Yu Li, Jia Wei Li, Li Li (Classement des annonces), Li Yuan Li, Mingda Li, Wen Yuan Li, Rocky Liu, Jason Lu, Robert Luo, Yinbin Ma, Sandeep Pandey, Ouladzimir Pashkevitch, Varna Pouvvada, Michael Shao, Pranav Sharma, Zijian Shen, Vibha Sinha, Matt Steiner, Soleil de Chonglin, Soleil de Weiman, Aaron (Li Bo) Tao, Xiaohan Wei, Nathan Yan, Yantao Yao, Hongtao Yu, Li Yu, Sihan Zeng, Buyun Zhang, Bill Zhao, Alex Zhong, Zhehui Zhou, unet l'intégralité Équipe V équipe derrière le développement et la production du modèle d'exécution à l'échelle LLM dans le système de recommandation d'annonces de Meta.
