Il s'agit du deuxième article de la série de blogs Ranking Engineer Agent explorant les capacités d'IA autonomes qui accélèrent l'innovation en matière de classement des annonces de Meta.. Le message précédent introduction de la capacité d’exploration ML de Ranking Engineer Agent, qui conçoit de manière autonome, exécute, et analyse les expériences de modèles de classement. Cet article explique comment optimiser l'infrastructure de bas niveau qui permet à ces modèles de fonctionner efficacement à grande échelle.. Nous présentons KernelEvolve, un système de création de noyau agentique utilisé par Ranking Engineer Agent et généralement applicable à une gamme de modèles d'IA au-delà du classement des annonces.

Résumé

  • Meta exploite une large flotte de matériel hétérogène – GPU NVIDIA, GPU AMD, Puces de silicium MTIA personnalisées de Meta, et processeurs. Utiliser ce matériel de manière efficace et efficiente nécessite de développer logiciel qui traduit les opérations de modèle de haut niveau en efficacité, instructions spécifiques à la puce appelées noyaux optimisés. La création et l'optimisation des noyaux doivent être effectuées pour chaque nouvelle génération de puces et architecture de modèle ML. Au-delà des opérateurs de noyau standards comme multiplications matricielles générales (GEMM) et convolutions couvertes par les bibliothèques des fournisseurs, les charges de travail de production nécessitent de nombreux opérateurs personnalisés dans les modèles de classement. Avec le nombre de modèles et le nombre de types et de générations de matériel, le réglage manuel par les experts du noyau ne s'adapte pas.
  • Pour répondre au volume de travail d'optimisation des performances requis par le nombre croissant de modèles X nombre de types de matériel & générations, nous avons construit NoyauEvolve, un agent pour optimiser les performances utilisé par Agent ingénieur de classement de Meta. Il permet:
    • Développement plus rapide: Compresse des semaines de temps d'ingénierie expert pour optimiser les noyaux, y compris le profilage, optimisation, et débogage multi-matériel, en heures de recherche et d'évaluation automatisées, libérer les ingénieurs pour d'autres travaux.
    • Better performance: Sur 60% amélioration du débit d'inférence pour le Andromède Modèle publicitaire sur les GPU NVIDIA et plus 25% amélioration du débit de formation pour un modèle publicitaire sur les puces de silicium MTIA personnalisées de Meta.
    • Large applicabilité: Optimise le matériel public et propriétaire, y compris les GPU NVIDIA, GPU AMD, MIA puces et processeurs, générer des noyaux dans des DSL de haut niveau comme Triton, Mignon DSL, et FlyDSL, ainsi que des langages de bas niveau dont CUDA, HANCHE, et MTIA C++.
  • KernelEvolve traite l'optimisation du noyau comme un problème de recherche: un faisceau de tâches spécialement conçu évalue chaque noyau candidat, renvoie les diagnostics au LLM, et conduit une recherche continue parmi des centaines d'alternatives, dépassant les performances des noyaux générés par des experts humains.
  • Plus de détails sont disponibles dans le document, "NoyauEvolve: Mise à l'échelle du codage de noyau agentique pour les accélérateurs d'IA hétérogènes chez Meta,» qui apparaîtra au 53ème Symposium international sur l'architecture informatique (APPÂT) 2026.

Tous les jours, Meta sert des milliards d'expériences basées sur l'IA, de la recommandation personnalisée aux assistants IA génératifs, sur une infrastructure mondiale comprenant divers matériels de NVIDIA, DMLA, et les puces de silicium MTIA personnalisées de Meta. Derrière chaque demande de formation ou d'inférence se cache une couche de noyaux matériels de bas niveau hautement optimisés.: petits programmes qui traduisent les opérations de modèle de haut niveau en instructions qu'une puce spécifique peut exécuter efficacement. À mesure que les modèles d’IA deviennent plus complexes et que le paysage matériel se diversifie, le nombre de noyaux évolue sur toutes les plates-formes matérielles, architectures de modèles et types d'opérateurs, résultant en des milliers de configurations qui ne peuvent plus être réglées de manière réaliste par des experts humains, créant un goulot d'étranglement critique qui retarde l'activation du matériel et le réglage des performances et ralentit les cycles d'itération du modèle qui conduisent à des avancées critiques dans la technologie ML et ses applications.

Aujourd'hui, nous partageons NoyauEvolve, un système d'IA agentique qui a amélioré le débit d'inférence du modèle publicitaire en 60% en heures d'expérimentation, une tâche qui prendrait des semaines aux experts humains. KernelEvolve génère et optimise de manière autonome des noyaux de production pour le matériel hétérogène utilisé dans la formation et l'inférence, y compris les GPU NVIDIA, GPU AMD, Le silicium MTIA personnalisé de Meta, et processeurs. Contrairement au grand modèle de langage typique (LLM)-agents basés sur qui effectuent une génération de code unique, KernelEvolve traite l'optimisation du noyau comme un problème de recherche. Il explore des centaines d'implémentations alternatives du noyau pour identifier une solution qui égale ou dépasse souvent les performances des experts humains., et le fait en quelques heures au lieu de semaines. Dans l’environnement de production de Meta, KernelEvolve optimise le code qui sert des milliards de requêtes d'inférence quotidiennes.

KernelEvolve représente un changement fondamental dans la façon dont nous envisageons la relation entre les logiciels et le matériel d'IA. Là où le développement du noyau était autrefois un manuel, processus piloté par des experts qui a eu du mal à suivre le rythme de l'évolution du matériel et des modèles, KernelEvolve le rend continu et automatisé – en s'adaptant à chaque changement. Alors que Meta continue de diversifier son portefeuille de matériel d'IA, the ability to rapidly generate optimized kernels for new chips substantially reduces the engineering effort required to integrate heterogeneous hardware for training and inference.

Le défi: Le goulot d’étranglement de la croissance explosive du noyau

Nous assistons à une croissance explosive des noyaux, car le nombre total de noyaux évolue selon le produit de trois facteurs.: {types et générations de matériel X architectures de modèles X nombre d'opérateurs}. Ce produit génère des milliers de configurations de noyau uniques qui doivent être écrites, testé, et entretenu. Le réglage manuel de chaque noyau ne s'adapte pas, et les experts du noyau ne peuvent pas à eux seuls suivre le rythme.

Hétérogénéité matérielle

La flotte d'accélérateurs de Meta couvre désormais les GPU NVIDIA, GPU AMD, et la coutume de Meta MIA silicium, chacun avec des architectures et des hiérarchies de mémoire fondamentalement différentes, jeux d'instructions, et modèles d'exécution. Un noyau qui fonctionne de manière optimale sur une plate-forme peut fonctionner mal ou échouer complètement sur une autre.. Et la complexité ne s’arrête pas aux frontières des fournisseurs. Même au sein d’une seule famille de matériel, les générations successives introduisent des changements architecturaux qui nécessitent des stratégies d'optimisation différentes. La feuille de route MTIA de Meta couvre quatre générations de puces en deux ans (MIA 300 à travers 500), chacun introduisant de nouvelles capacités de calcul, caractéristiques de la bande passante mémoire, et types de données numériques optimisés pour les charges de travail évolutives. Un noyau optimisé pour une génération sera sous-performant lorsqu'il sera exécuté sur la prochaine génération de la même architecture matérielle.

Variation de l'architecture du modèle

Les modèles de recommandation de Meta ont évolué en trois phases principales: à partir des premiers modèles de recommandation d'apprentissage profond basés sur l'intégration, à modèles d'apprentissage de séquence qui traitent les historiques d'engagement avec des mécanismes d'attention, chez Meta Modèle de recommandation d'annonces génératives (GEMME), et plus récemment Meta's modèle d'inférence de base qui apporte une échelle LLM aux publicités (Modèle de classement méta-adaptatif). Chaque génération introduit des types d'opérateurs dont la génération précédente n'avait jamais eu besoin. Au-delà de ces changements générationnels, La pile de production de Meta sert simultanément des familles de modèles fondamentalement différentes, chacun avec ses propres opérateurs uniques, et une seule demande d'annonces peut concerner plusieurs familles au cours d'un seul appel de diffusion.. Avec un nombre vaste et croissant de modèles distincts en production, chaque nouvelle architecture étend la matrice d'opérateurs qui doivent être optimisés sur l'ensemble du matériel.

Diversité du noyau au-delà des bibliothèques standards

Les bibliothèques de fournisseurs telles que cuBLAS et cuDNN couvrent un ensemble d'opérations courantes : GEMM., circonvolutions, activations standard - mais même ces opérateurs standard résistent aux solutions universelles. Un seul opérateur comme la multiplication matricielle se comporte différemment selon les contextes: Le noyau optimal pour un lot de formation diffère d'une demande de diffusion d'inférence, et les formes des tenseurs varient considérablement selon les étapes de classement et les modèles de classement, créer un espace combinatoire de configurations que ni les experts humains ni les réglages automatiques et la fusion actuels basés sur un compilateur ne peuvent couvrir entièrement à grande échelle. Au-delà des opérateurs standards, les charges de travail de production sont dominées par une longue file d’opérateurs qui ne sont pas couverts par la bibliothèque. Il s'agit notamment des transformations de prétraitement des données telles que le hachage de fonctionnalités., mise en godets, et troncature de séquence qui préparent les entrées brutes pour l'inférence du modèle, ainsi que des opérateurs de modèles personnalisés tels que des couches d'interaction de fonctionnalités fusionnées et des variantes d'attention spécialisées uniques aux architectures de Meta..

Aucun de ces opérateurs personnalisés n'apparaît dans les bibliothèques des fournisseurs, et beaucoup sont trop spécifiques à la charge de travail pour justifier une implémentation de bibliothèque. Sans implémentations d'accélérateurs natifs, ces opérateurs se tournent soit vers le processeur (ce qui impose des architectures de service désagrégées avec une surcharge de latence importante), soit s'exécutent via des chemins de code non optimisés qui sous-utilisent le matériel..

Le problème s’aggrave avec la diversité matérielle. Un noyau NVIDIA réglé manuellement ne peut pas simplement être recompilé pour les GPU AMD ou MTIA. Chaque nouvelle architecture de modèle étend davantage la queue, et chaque nouvelle puce multiplie le travail nécessaire pour la couvrir.

Comment KernelEvolve relève ces défis

Chaque défi correspond à une décision architecturale spécifique:

Défi Comment KernelEvolve y répond
Hétérogénéité matérielle Une base de connaissances augmentée par la récupération injecte une documentation spécifique à la plate-forme, y compris des manuels d'architecture, jeux d'instructions, et/ou des modèles d'optimisation dans le contexte de génération. Le LLM raisonne sur cette documentation au moment de l'inférence : aucune formation préalable sur le matériel cible n'est requise. Une interface d'invite universelle unique élimine les modèles d'invite par plateforme.
Variation de l'architecture du modèle La recherche arborescente explore les alternatives de mise en œuvre pour tout opérateur, y compris les nouveaux. Les optimisations réussies sont distillées dans des modèles réutilisables qui sont transférés entre les familles de modèles : une optimisation découverte pour une architecture accélère les opérateurs similaires dans les futures..
Diversité du noyau / Longue queue L'évaluation automatisée valide des centaines de candidats en parallèle. L'optimisation basée sur la recherche remplace le besoin de réglage manuel, rendre les opérateurs réalisables qui ne justifieraient pas autrement des semaines de réglage manuel.


NoyauEvolve: Recherche de noyaux optimaux

KernelEvolve aborde ce défi différemment des assistants de codage IA standard. Plutôt que d'inviter un LLM à générer un seul noyau et à le tester, le système formalise l'optimisation du noyau comme un problème de recherche structuré dans l'espace des implémentations possibles. Sous le capot, un faisceau d'emplois de longue durée spécialement conçu pilote chaque itération - compilation des candidats, évaluer l'exactitude et la performance, profilage de l'utilisation du matériel, et générer des rapports d'analyse, tout en gérant les cycles de construction de plusieurs minutes et les pannes d'infrastructure qui rendent les approches natives peu pratiques..

image[1]-NoyauEvolve: Comment l'agent Ranking Engineer de Meta optimise l'infrastructure d'IA pour Windows 7,8,10,11-Winpcsoft.com
Chiffre 1: ​​Comment une demande d'optimisation du noyau circule à travers les six composants de KernelEvolve.

Synthétiseur LLM

Un LLM génère des noyaux candidats dans plusieurs langages de programmation et cibles matérielles, à partir de DSL de haut niveau comme Triton., TLX, Mignon DSL, et FlyDSL, aux backends de bas niveau, y compris CUDA, HANCHE, et MTIA C++.

Plutôt que d'utiliser des invites statiques, le synthétiseur construit dynamique, invites contextuelles qui sont continuellement enrichis de diagnostics d'exécution, contraintes matérielles, et les signaux historiques de l'évaluation précédente de l'optimisation des candidats. Cela remplace l'approche traditionnelle consistant à conserver des modèles d'invite distincts pour le débogage., réglage des performances, et vérification de l'exactitude avec une interface adaptative unique qui unifie ces flux de travail en une interface adaptative unique qui pilote une gestion continue., boucle d'optimisation basée sur la rétroaction.

Moteur de recherche d'arborescence

Le système explore l'espace d'optimisation à l'aide d'algorithmes de recherche basés sur des graphiques, y compris la recherche arborescente de Monte Carlo et les stratégies évolutives. Chaque candidat du noyau devient un nœud dans un arbre de recherche. Le moteur sélectionne les candidats prometteurs, applique des transformations, évalue les résultats, et décide s'il faut explorer plus avant ou revenir en arrière - en équilibrant l'exploitation de stratégies connues et l'exploration de nouvelles approches.

Surtout, les nœuds n'évoluent pas de manière isolée. Chaque nœud transporte un opérateur de mémoire configurable qui détermine comment il extrait le contexte de l'arbre de recherche lors de la génération de la prochaine série de candidats.. Un nœud peut hériter de la trajectoire d'optimisation de son parent pour affiner une direction prometteuse, comparer avec les frères et sœurs pour savoir ce qui différencie les variantes les plus performantes, combiner les connaissances des histoires des parents et des frères et sœurs, ou commencer par une table rase pour échapper aux optima locaux. Ce mécanisme de mémoire sélective permet à la recherche arborescente d'aller au-delà du simple échantillonnage indépendant : les nœuds frères collaborent en faisant apparaître des stratégies complémentaires., les chaînes parent-enfant préservent et approfondissent les chemins d'optimisation réussis, et les redémarrages sans mémoire injectent de la diversité lorsque la recherche stagne.

image[2]-NoyauEvolve: Comment l'agent Ranking Engineer de Meta optimise l'infrastructure d'IA pour Windows 7,8,10,11-Winpcsoft.com
Chiffre 2: Comment le moteur de recherche arborescente parcourt l'espace d'optimisation pour trouver des noyaux hautement performants.

Base de connaissances améliorée par la récupération

Pour générer du code optimisé pour le matériel sur lequel le LLM sous-jacent n'a jamais été formé, KernelEvolve maintient une base de connaissances hiérarchique organisée en trois catégories: contraintes d'exactitude qui imposent des implémentations valides du noyau, conseils d'optimisation indépendants de la plate-forme couvrant les stratégies de débogage et de réglage, et une documentation spécifique au matériel contenant des détails architecturaux pour chaque plate-forme d'accélérateur. Le système récupère dynamiquement les connaissances pertinentes en fonction des signaux d'exécution.. Par exemple, un goulot d'étranglement de bande passante mémoire déclenche la récupération de la documentation sur la hiérarchie de la mémoire; une erreur de compilation active le guidage de débogage.

Cette base de connaissances n'est pas statique. À mesure que le système résout de nouveaux problèmes d'optimisation, il distille les stratégies efficaces en compétences réutilisables (modèles d'optimisation compacts et heuristiques de débogage) qui sont continuellement réécrites dans la base de connaissances.. Cette bibliothèque de compétences auto-évolutive agit comme une forme de apprentissage par renforcement en contexte: Chaque exploration réussie enrichit le contexte disponible pour les sessions futures, permettre au système de résoudre des problèmes similaires plus rapidement et avec moins d'étapes de recherche, sans nécessiter de recyclage du modèle.

Cadre d'évaluation automatisé

Chaque noyau généré passe par un pipeline de validation rigoureux qui vérifie à la fois l'exactitude (la précision au niveau du bit par rapport aux implémentations de référence) et les performances.. Et l'évaluation va bien au-delà d'un seul numéro d'exécution.

KernelEvolve exploite une pile d'outils de profilage, chacun ciblant un niveau d’analyse différent. Banc Triton valide l'exactitude numérique par rapport aux lignes de base de PyTorch et mesure l'accélération de bout en bout à travers les formes d'entrée de production. PyTorch Profiler capture les délais d'exécution au niveau du système, y compris la surcharge de lancement du noyau et la synchronisation hôte-périphérique. Pour les cibles GPU, des outils comme UNC fournir des métriques matérielles au niveau du noyau - occupation, débit mémoire, mélange d'instructions - tandis que Proton fournit une latence au niveau des instructions intra-noyau et un comportement du pipeline. Pour les cibles MTIA, MTIA Insight fournit une instrumentation complète spécifique aux accélérateurs: Utilisation du PE, métriques du moteur à fonction fixe (DPE, SFU, Cycles d'utilisation et de décrochage du MLU), comportement du cache, et compteurs de bande passante mémoire par PE.

Plutôt que de traiter ces outils comme des étapes autonomes, KernelEvolve les unifie grâce à une abstraction centrée sur le compilateur. Le cadre compose l'analyse à travers des graphiques de travail: le compilateur transforme l'insertion d'une instrumentation de niveau MLIR, les passes de profilage collectent des métriques, et la synthèse de traces produit une sortie structurée. Cela signifie que le moteur de recherche ne voit pas seulement « le noyau A est 1,2 fois plus rapide que le noyau B » – il voit pourquoi: si le goulot d'étranglement est lié à la mémoire, lié au calcul, ou limité par l'occupation - et renvoie ce signal de diagnostic dans le synthétiseur LLM pour guider la prochaine série de candidats.

Fondation de données partagée

Chaque session d'optimisation contribue à une base de données partagée. Quand l’exploration d’un ingénieur découvre une stratégie de carrelage efficace pour une classe d’opérateurs, ces informations deviennent disponibles pour chaque session future ciblant des charges de travail similaires, créant un effet cumulatif dans lequel le système devient plus performant à chaque utilisation. Les premiers utilisateurs effectuent l'exploration la plus difficile; les utilisateurs ultérieurs héritent beaucoup plus près des points de départ optimaux et affinent à partir de là.

Apprentissage par renforcement agent

Chaque session d'optimisation génère des données d'entraînement structurées comme sous-produit naturel: trajectoires agentiques capturant le raisonnement, transformations de code, et commentaires d'évaluation derrière les noyaux hautes performances. Ces données spécifiques au domaine sont rares et précieuses. Il code l'intuition d'optimisation qu'aucun ensemble de données public ne contient.

Nous utilisons ces données pour post-former des plus petits, modèles spécialisés grâce à l'apprentissage par renforcement agent, où le signal de récompense provient directement des performances mesurées du noyau. Le résultat est un cercle vertueux dans lequel de meilleurs modèles produisent de meilleurs noyaux avec moins de jetons de raisonnement et moins d'étapes de recherche., qui à leur tour génèrent des données de formation de meilleure qualité. Au fil des itérations successives, ce volant d'inertie composé nous permet d'auto-héberger des modèles de plus en plus efficaces, suffisamment compacts pour fonctionner de manière rentable à grande échelle tout en conservant la capacité d'optimisation de modèles frontières beaucoup plus grands..

Activation des puces IA propriétaires

L'une des capacités les plus importantes de cette architecture est sa capacité à générer du code optimisé pour du matériel qui n'existe dans aucun ensemble de données de formation public..

Les puces MTIA personnalisées de Meta présentent un défi de programmation unique. Parce que ces puces sont propriétaires, aucun LLM public n'a été formé sur le code MTIA. Un assistant de codage standard n'a pas le contexte nécessaire pour écrire des noyaux MTIA optimisés car il n'a jamais vu la documentation MTIA., détails du jeu d'instructions, ou des idiomes de programmation.

KernelEvolve résout ce problème grâce à l'injection systématique de connaissances. Nous encodons la documentation spécifique à MTIA (manuels d'architecture, références aux jeux d'instructions, spécifications de la hiérarchie de la mémoire, et modèles d'optimisation) directement dans la base de connaissances augmentée par récupération. Lorsque le système cible MTIA, il récupère et intègre ces connaissances propriétaires dans son raisonnement, « apprendre » efficacement le matériel en temps réel.

Cette approche s'étend à tout nouvel accélérateur. Quand une nouvelle puce arrive, le coût d'ingénierie passe de l'écriture manuelle de milliers de noyaux à la conservation d'un ensemble de documents matériels et à leur injection dans la base de connaissances. Le système génère ensuite de manière autonome des noyaux optimisés pour la nouvelle plateforme, s'assurer que la pile logicielle est prête à la vitesse du déploiement du matériel plutôt qu'à la vitesse de l'ingénierie manuelle.

L'impact de KernelEvolve sur les tests de référence et la production

KernelEvolve a fourni d'excellents résultats à la fois sur les tests de référence standardisés et sur les charges de travail de production..

Performances de référence: Sur KernelBench, une suite de référence de 250 problèmes d'optimisation du noyau de Stanford couvrant trois niveaux de difficulté, KernelEvolve réalise un 100% passer taux — tous les noyaux générés sont à la fois fonctionnellement corrects et plus rapides que leurs implémentations de référence PyTorch. Le système valide également 160 Opérateurs PyTorch ATen avec 100% exactitude sur trois plates-formes matérielles (480 configurations totales).

Production accélérations: Possède les puces MTIA de Meta, Noyaux générés par KernelEvolve, qui s'étendait sur le calcul, lié à la mémoire, et opérations personnalisées, atteint des accélérations de plus de 25% amélioration du débit de formation sur un modèle publicitaire. Sur les GPU NVIDIA, il a livré plus de 60% amélioration du débit d'inférence par rapport à un modèle avec des noyaux hautement optimisés comprenant torch.compile et les bibliothèques des fournisseurs — des gains de performances qui se traduisent directement par la capacité de service et l'efficacité de l'infrastructure.

Matériel couverture: Le système génère des noyaux optimisés pour les GPU NVIDIA, GPU AMD, Le silicium MTIA personnalisé de Meta, et processeurs - à partir d'un seul cadre unifié. Plutôt que de conserver des modèles d'invites distincts par plateforme, le système récupère dynamiquement les contraintes spécifiques au matériel et les modèles d'optimisation, s'adapter à chaque cible grâce à l'augmentation de la récupération plutôt qu'à l'ingénierie manuelle des invites.

Vitesse de développement

Développement du noyau qui nécessitait auparavant des semaines d'efforts d'experts - profilage, itérer sur les stratégies de carrelage, débogage des cas extrêmes sur le matériel – s'effectue désormais en quelques heures grâce à la recherche et à l'évaluation automatisées. Cela déplace le temps des ingénieurs de l'écriture de code de bas niveau vers des tâches à plus forte valeur ajoutée telles que la conception d'architectures de modèles., améliorer les techniques de formation, et définition des objectifs d'optimisation.

Comment tout s’articule

Un ingénieur précise un opérateur cible, plateforme matérielle, et objectifs de performance. Le système est ensuite autonome:

  1. Récupère documentation matérielle pertinente et connaissances en optimisation de la base de connaissances.
  2. Génère un ensemble initial de candidats noyau utilisant le synthétiseur LLM avec des invites contextuelles.
  3. Évalue chaque candidat pour l'exactitude et les performances à l'aide d'une infrastructure d'analyse comparative distribuée.
  4. Résultats des flux revenir dans le moteur de recherche, qui sélectionne les candidats les plus prometteurs et applique d'autres optimisations.
  5. Itère mesures 1-4, explorer l'arborescence de recherche jusqu'à ce que les critères de terminaison soient remplis - soit un objectif de performance est atteint, le budget de recherche est épuisé, ou des stagnations de progrès.
  6. Sorties le plus performant, noyau entièrement validé, prêt pour le déploiement en production.

Le processus s'exécute sur l'infrastructure distribuée de Meta, évaluer des milliers de candidats en parallèle. Le stockage persistant des arbres de recherche et des implémentations permet au système de s'appuyer sur des résultats antérieurs lors du ciblage d'un nouveau modèle. variantes ou générations de matériel.

Regarder vers l'avenir

Les mêmes techniques agentiques qui alimentent KernelEvolve : raisonnement structuré, connaissance augmentée par récupération, évaluation en boucle fermée — peut être appliquée à la recherche de modèles hybrides, optimisation du compilateur, gestion de la mémoire, et configuration du système. NoyauEvolve représente un premier pas vers la vision d’un Agent ingénieur de classement qui peut optimiser en permanence sa propre infrastructure critique en termes de performances.

Au sein de la REA, Exploration ML découvre de meilleurs modèles. KernelEvolve les rend prêts pour la production. Ensemble, ils accélèrent la rapidité avec laquelle les améliorations de classement parviennent aux annonceurs.

Dans le prochain article de la série REA, où nous explorerons d'autres optimisations de ML agentique.

Lire le document

Pour plus de détails techniques, lire notre article, "NoyauEvolve: Mise à l'échelle du codage de noyau agentique pour les accélérateurs d'IA hétérogènes chez Meta” from APPÂT 2026.

Remerciements

Nous tenons à remercier Ying Wang, Hongsen Qin, Tao-Yang, Jia Jiunn Ang, Yujia Il, Alicia D'or, Michael Kutchnik, Wei Guo, Yihan Il, Jiang Yuan Li, Dian Shi Li, Chao Xie, Adèle Soleil, Richard Li, Alec Hammond, Romain Levenstein, Hongtao Yu, Yuanwei (Kévin) Croc, Kunming Hô, Haishan Zhu, Site Cao, Abdallah Oztürk, Jort Gemmeke, Daniel Wang, Juan Angeles Acuña, Yoram Bachrach, Ming Chen, Terry Chen, Jake Cheng, Wayne Chiang, Wen Yuan Chi, Rick Chang, Wyatt Cook, Les Trois Taos, Barry Dong, Lioubov Dmitrieva, Derek Dunfield, Zhou Fang, Robert Fergus, Maxwell Harrison Fisch, Poissons de Zacharie, Zach Freeman, Chunli Fu, Vishal Gandhi, Kaustubh Gondkar, Wentian Guo, Han Guo, William Hanwei Liang, Samuel Hsia, Barney Huang, Nicolas de Hongrie, Martin Josifoski, Jacob Kahn, Shobhit Kanaujia, Drew Lackman, Marek Latuskiewicz, Christine Lauter, Mère Lévi, Evan Li, Yiting Li, Jiang Liu, Alexeï Loginov, Yining Lu, Anuj Madan, Jean Martabano, Anna Mcburney, Keyur Muzumdar, Kelvin Nouveau, Sandeep Pandey, Ouladzimir Pashkevitch, Dmitri Pedchenko, Pedro Pedreira, Varna Pouvvada, Prayas Janak Shah, Bidit Sharma, Feng Shi, Stanley Shi, Ketan Singh, Vibha Sinha, Matt Steiner, Gabriel Synnaève, Alexandre Stachouk, Jim Tao, Ritwik Tewari, Chris Wiltz, Yao Xuan, Non Yan, Bill Yoshimi, Xiao Yu, Abdul Zainul-Abedin, Qing Zhang, et Mingjie Zhu