Meta continua a liderar a indústria na utilização de sistemas de recomendação de IA inovadores (RecSys) para oferecer melhores experiências às pessoas, e melhores resultados para os anunciantes. Para alcançar a próxima fronteira de desempenho, estamos dimensionando os modelos de tempo de execução do recomendador de anúncios da Meta para a escala LLM & complexidade para promover uma compreensão mais profunda dos interesses e intenções das pessoas.

Este aumento de escala & a complexidade exacerba um “trilema de inferência” fundamental: o desafio de equilibrar o aumento da complexidade do modelo e a necessidade associada de computação e memória com a baixa latência e a eficiência de custos necessárias para um serviço global que atende bilhões de pessoas. Para superar isso, desenvolvemos o modelo de classificação meta adaptativo, que efetivamente dobra a curva de escala de inferência com alto ROI e eficiência líder do setor.

O modelo de classificação adaptativo substitui uma abordagem de inferência “tamanho único” por uma abordagem inteligente solicitar roteamento. Alinhando dinamicamente a complexidade do modelo com uma compreensão rica do contexto e da intenção de uma pessoa, o sistema garante que cada solicitação seja atendida pelo mais eficaz & modelo eficiente. Isso permite que a Meta Ads mantenha o estrito, latência de menos de um segundo da qual a plataforma depende, ao mesmo tempo que fornece uma experiência de alta qualidade para cada pessoa.

foto[1]-Modelo de classificação meta adaptativa: Dobrando a curva de escala de inferência para servir modelos em escala LLM para anúncios para Windows 7,8,10,11-Winpcsoft.com Servir modelos em escala LLM na escala Meta exigiu um repensar fundamental da pilha de inferência, impulsionado por três inovações principais:

  • Dimensionamento de modelo com eficiência de inferência: Mudando para uma arquitetura centrada em solicitações, O modelo de classificação adaptativo atende a uma escala LLM & modelo de complexidade com latência inferior a um segundo, permitindo uma compreensão mais sofisticada dos interesses e intenções de uma pessoa sem comprometer a experiência.
  • Co-design de modelo/sistema: Desenvolvendo arquiteturas de modelos com reconhecimento de hardware que alinham o design do modelo com o sistema de hardware subjacente e as capacidades e limitações do silício, O modelo de classificação adaptativo melhora significativamente a utilização de hardware em ambientes de hardware heterogêneos.
  • Infraestrutura de serviço reimaginada: Aproveitando arquiteturas de múltiplas placas e otimizações específicas de hardware, Modelo de classificação adaptativo permite O(1T) escala de parâmetros, permitindo-nos servir os modelos RecSys de tempo de execução em escala LLM com eficiência sem precedentes.

Integrando ainda mais a inteligência em escala LLM em nossa pilha de anúncios, O modelo de classificação adaptável oferece um aumento significativo nas conversões de anúncios e no valor do anunciante, ao mesmo tempo que mantém a eficiência computacional de todo o sistema. Isso garante desempenho superior para empresas de todos os tamanhos. Desde o lançamento no Instagram no quarto trimestre 2025, O modelo de classificação adaptativo forneceu um +3% aumento nas conversões de anúncios e +5% aumento na taxa de cliques em anúncios para usuários-alvo.

Apresentando o modelo de classificação meta adaptativa

Servindo em escala LLM & modelos de complexidade em um ambiente de recomendação de anúncios em tempo real exigem a resolução de uma tensão fundamental entre a complexidade do modelo e a eficiência do sistema. Ao contrário de aplicativos LLM, como chatbots, onde os tempos de resposta são medidos em segundos, uma recomendação de anúncio deve atender a duas restrições inflexíveis:

  1. A latência afeta a experiência do usuário: Os anúncios devem ser escolhidos e retornados com latência inferior a um segundo. Escalar a computação de anúncios para o nível LLM e além tem sido tradicionalmente impossível sem regressões de latência que comprometem a experiência do usuário.
  2. A eficiência de custos é crucial: O dimensionamento de força bruta simplesmente adicionando hardware é economicamente insustentável. Alcançar um ROI positivo requer desbloquear uma maior complexidade do modelo sem um aumento correspondente nos custos totais.

O modelo de classificação adaptativo aborda esses desafios por meio de uma mudança de paradigma impulsionada por três inovações principais em toda a pilha de serviços:

  • Dimensionamento de modelo com eficiência de inferência: Modelo de classificação adaptativo atinge uma complexidade de modelo equivalente ao O(10 GFLOPs) por token usado por LLMs de nível superior. No entanto, ele opera uma ordem de magnitude mais rápida do que a inferência LLM padrão, mantendo Ó(100 EM) latência limitada.
  • Co-design profundo de modelo-sistema: O modelo de classificação adaptativo é profundamente co-projetado com o hardware e o silício subjacentes; aumentamos a utilização de modelos FLOPs (PERDA) para 35% em vários tipos de hardware.
  • Infraestrutura de atendimento reimaginada: O Adaptive Ranking Model utiliza uma infraestrutura de serviço de GPU multiplaca para quebrar os limites de memória física de dispositivos únicos. Isso nos permite dimensionar os parâmetros do modelo para Ó(1T), providing a depth of understanding of people’s interests and intent previously impossible at Meta’s scale.

Ao unificar essas inovações, garantimos que o modelo mais eficaz seja usado para cada solicitação — proporcionando uma experiência de anúncio altamente personalizada para as pessoas em nossas plataformas e maximizando o valor do anunciante, mantendo a eficiência computacional de todo o sistema.

foto[2]-Modelo de classificação meta adaptativa: Dobrando a curva de escala de inferência para servir modelos em escala LLM para anúncios para Windows 7,8,10,11-Winpcsoft.com

Dimensionamento de modelo com eficiência de inferência

O Adaptive Ranking Model introduz inovações no sistema de modelo que redefinem fundamentalmente a eficiência da inferência. Esta transformação é construída sobre três pilares técnicos:

  • Transformando custos de escala de linear para sublinear mudando para um fluxo de computação orientado a solicitações que elimina redundância massiva em escala LLM.
  • Maximizando o rendimento estrutural por meio de refinamentos arquitetônicos que estabilizam modelos profundos e minimizam gargalos de rede interna.
  • Neutralizando a sobrecarga de complexidade por meio da otimização holística da latência, descarregando o pré-processamento de recursos para GPUs e simplificando o caminho de execução ponta a ponta.

Transformando custos de escala de linear para sublinear

Os modelos tradicionais processam cada par usuário-anúncio de forma independente, criando redundância computacional massiva. O modelo de classificação adaptativo elimina isso por meio da otimização orientada a solicitações, que calcula sinais de usuário de alta densidade uma vez por solicitação, em vez de uma vez por candidato a anúncio. Esta mudança, alimentado por compartilhamento de computação orientado a solicitações e otimização de transmissão no kernel, que compartilha incorporações em nível de solicitação entre candidatos a anúncios diretamente no kernel da GPU, transforma os custos de escalonamento de linear em sublinear, ao mesmo tempo que reduz significativamente a pressão da largura de banda da memória.

Com base nisso, O escalonamento de sequência orientado a solicitações desbloqueia o uso de sequências longas de comportamento do usuário que antes eram limitadas por custos de computação e armazenamento. Para minimizar a sobrecarga de computação, O modelo de classificação adaptável processa sequências pesadas uma vez por solicitação e compartilha os resultados com todos os candidatos a anúncios. Para otimizar o armazenamento, ele substitui a replicação redundante de dados por uma centralizada, armazenamento de valores-chave de alta eficiência de logs de usuário que são unidos com dados de treinamento dinamicamente. Em conjunto, essas otimizações minimizam os espaços de serviço e armazenamento necessários para sistemas em escala global.

Maximizando o rendimento estrutural com Wukong Turbo

Enquanto Otimização Orientada a Solicitações otimiza o fluxo de computação, Wukong Turbo é a evolução do tempo de execução otimizado da arquitetura interna do Meta Ads. Construindo sobre o Arquitetura Wukong que usa máquinas de fatoração empilháveis, aprendizagem de sequência e atenção entre camadas, Wukong Turbo introduz refinamentos específicos para lidar com a instabilidade numérica e sobrecarga de rede que normalmente surgem ao dimensionar modelos profundos. Especificamente, emprega uma abordagem sem preconceitos para remover termos instáveis, aumentando o rendimento sem aumentar FLOPs ou contagens de parâmetros. Para evitar gargalos internos, ele utiliza delegação de pequenos parâmetros para reduzir a sobrecarga de rede e memória, descarregando parâmetros de Fully Sharded Data Parallel (FSDP) para dados distribuídos paralelamente (DDP) juntamente com a simplificação baseada na dispersão que reduz componentes redundantes nas camadas lineares. Essas melhorias transformam a arquitetura básica em uma arquitetura estável, sistema de alto desempenho, permitindo que a complexidade do modelo aumente enquanto protege estritamente o orçamento de inferência abaixo de um segundo.

Neutralizando a sobrecarga de complexidade por meio da otimização holística da latência

O estágio final dessa transformação aborda o pré-processamento de recursos – um gargalo tradicional levando à pressão da memória do cliente e à falta de dados, onde o poder de computação da GPU permanece subutilizado enquanto aguarda recursos processados. O Adaptive Ranking Model descarrega o pré-processamento da CPU do cliente para hosts de GPU remotos, utilizando formatos compactos baseados em tupla e kernels nativos de GPU que reduzem a complexidade do Top-K de Ó(N log N) para Ó(N). Para acelerar ainda mais o processamento, implementamos uma estratégia holística de compactação de dados otimizada e reestruturação do fluxo de clientes para eliminar a contenção do pool de threads. Essas otimizações em várias camadas neutralizaram com sucesso a penalidade de latência da escala LLM & complexidade, permitindo que o Adaptive Ranking Model forneça personalização de nível de fronteira na velocidade que as plataformas globais da Meta exigem.

Maximizando a eficiência por meio de codesign profundo de sistema de modelo

Meta Ads depende da cootimização profunda do sistema para permitir a complexidade do modelo em escala LLM dentro das restrições de desempenho em metaescala. Ao repensar fundamentalmente a fronteira entre o modelo e o hardware, criamos uma pilha de inferência unificada que otimiza a precisão computacional e a execução de gráficos para maximizar o ROI computacional, aumentando a utilização de FLOPs do modelo (PERDA) em hardware heterogêneo.

Inferência de alto rendimento com quantização seletiva FP8

Modelos em grande escala necessitam de precisão reduzida para manter inferência de alto rendimento, ainda assim, uma aplicação generalizada de quantização de baixa precisão muitas vezes degrada as nuances necessárias para a classificação de anúncios complexos. O Adaptive Ranking Model supera isso por meio de uma estratégia de quantização pós-treinamento que aplica o FP8 seletivamente. Usando um mecanismo de seleção guiada por micro-benchmark, o sistema implanta o FP8 apenas em camadas com alta tolerância à perda de precisão. Essa abordagem direcionada libera os benefícios de rendimento do hardware heterogêneo moderno para nossos modelos mais complexos, com impacto insignificante na qualidade da recomendação.

Especialização em gráfico e kernel com reconhecimento de hardware

Para minimizar a latência causada por acesso redundante à memória e inicializações ineficientes do kernel, O modelo de classificação adaptativo otimiza o fluxo de execução por meio de gráfico coordenado e especialização de kernel. Fundimos operadores que compartilham entradas para minimizar a movimentação de dados entre memória de alta largura de banda e SRAM no chip. Adicionalmente, milhares de pequenas operações são consolidadas em kernels densos em computação usando técnicas como Grouped General Matrix Multiply e fusão horizontal. Este alinhamento preciso entre o gráfico de computação e as arquiteturas modernas de GPU reduz significativamente o consumo de memória e aumenta a utilização efetiva do hardware, garantindo que a complexidade do modelo em escala LLM se traduza diretamente em desempenho.

Infraestrutura de atendimento reimaginada para a realidade da produção em escala LLM

Além da cootimização modelo-sistema, a implantação de modelos em escala LLM exige a reinvenção da infraestrutura de serviço subjacente. Para neutralizar a penalidade de latência de grande escala, o modelo de classificação adaptativo utiliza uma pilha especializada projetada para ultrapassar os limites de memória física e garantir a confiabilidade da produção em metaescala.

Escala de trilhões de parâmetros

Ao contrário dos LLMs padrão, modelos de recomendação são impulsionados por predominantemente esparsos, características categóricas. Mapear esses IDs para tabelas de incorporação de alta dimensão cria uma compensação crítica onde tabelas superdimensionadas levam a ajustes excessivos, enquanto tabelas subdimensionadas sofrem colisões de hash que degradam a qualidade do modelo. Modelo de classificação adaptativo permite O(1T) escala de parâmetros por meio de otimizações de memória que resolvem essa tensão. O sistema aloca com eficiência tamanhos de hash de incorporação com base na escassez de recursos e elimina embeddings não utilizados para maximizar a capacidade de aprendizagem dentro de orçamentos de memória rigorosos. Isso é ainda mais otimizado por incorporações unificadas, que permitem que vários recursos compartilhem uma única tabela de incorporação para reduzir significativamente o consumo de memória sem sacrificar a capacidade de aprender interações complexas de recursos.

Dimensionamento de incorporação de placas multi-GPU

À medida que a incorporação do modelo em escala LLM se aproximava do nível de terabyte, eles excederam a capacidade de memória de qualquer GPU. Para mitigar isso, um mecanismo de fragmentação de múltiplas placas divide a incorporação de tabelas em segmentos distribuídos em um cluster de hardware otimizado. Aproveitando otimizações de comunicação específicas de hardware, o sistema mantém alto rendimento e comunicação eficiente entre fragmentos. Esta arquitetura multiplaca alcança paridade de desempenho com configurações de placa única, dissociando efetivamente a complexidade do modelo das restrições individuais de hardware da GPU.

Resiliência e confiabilidade em tempo de execução

Servir modelos de trilhões de parâmetros sob condições de tráfego intenso apresenta desafios significativos de confiabilidade, particularmente em relação à velocidade de inicialização e estabilidade do sistema. Para garantir confiabilidade de nível de produção, desenvolvemos carregamento acelerado de modelos que utiliza download multistream e cache remoto para carregar modelos em menos de 10 minutos, minimizando o tempo de inatividade durante as implantações. Regras de escalonamento automático baseadas na utilização de multiprocessador de streaming permitem que o sistema lide com tráfego flutuante de forma dinâmica. Isso garante que a demanda em tempo real seja atendida sem a necessidade de desperdício de provisionamento excessivo, mantendo a estabilidade em toda a plataforma.

O caminho a seguir: Evoluindo a pilha de modelos de classificação adaptativa

O lançamento do Adaptive Ranking Model no Instagram marca o primeiro marco em nossa jornada para dobrar a curva de desempenho de inferência versus escala de custo na escala Meta. O roteiro muda de otimizações individuais para uma infraestrutura que é cada vez mais autônoma e responsiva a em tempo real flutuações na densidade do sinal do usuário e padrões de solicitação em nosso ecossistema global.

Essa visão começou com a evolução do dimensionamento eficiente de inferência para desbloquear uma complexidade mais profunda e sequências comportamentais mais longas que capturam a intenção do usuário com uma fidelidade sem precedentes. Para sustentar esse crescimento, somos pioneiros em uma nova era de eficiência na execução de inferências, aproveitando a compressão avançada de modelos e métodos de quantização de precisão ultrabaixa para permitir que os modelos mais sofisticados em escala LLM sejam executados com eficiência em uma frota global diversificada de hardware.

Para eliminar os gargalos tradicionais da engenharia manual, estamos explorando estruturas de otimização de agentes para acelerar ainda mais as otimizações de desempenho do kernel. Essas estruturas se adaptarão automaticamente a novas arquiteturas de hardware e modelos, garantindo que a IA mais sofisticada permaneça acessível e com bom desempenho em escala.

Além disso, estamos reimaginando a velocidade do aprendizado por meio da atualização quase instantânea do modelo, utilizando incremental, atualizações de peso no local para alcançar constante, adaptação em tempo real. Coletivamente, essas inovações garantirão que o modelo de classificação adaptativa continue a proporcionar experiências mais pessoais para as pessoas, ao mesmo tempo em que gera um ROAS superior para anunciantes em todo o mundo.

Agradecimentos

Gostaríamos de agradecer: Jia Jiunn Ang, Pan Chen, Wen Lin Chen, Maomao Ding, Ventilador Chengze, Lu Fang, Guan de Birmingham, Qin Huang, Santanu Kolay, Ashwin Kumar, Jinfu Long, Boda Li, Hua Yu Li, Jiawei Li, Li Li (Classificação de anúncios), Li Yuan Li, Mingda Li, Wen Yuan Li, Rocky Liu, Jason Lu, Roberto Luo, Yinbin Ma, Sandeep Pandey, Uladzimir Pashkevich, Varna Puvvada, Michael Shao, Pranav Sharma, Zijian Shen, Vibha Sinha, Matt Steiner, Sol de Chonglin, Sol de Weiman, Aarão (Li Bo) Tao, Xiaohan Wei, Nathan Yan, Yantao Yao, Hongtao Yu, Li Yu, Sihan Zeng, Buyun Zhang, Bill Zhao, Alex Zhong, Zhehui Zhou, ume o inteiro Equipe V equipe por trás do desenvolvimento e produção do modelo de tempo de execução em escala LLM no sistema de recomendação de anúncios da Meta.