Meta は、画期的な AI レコメンデーション システムの活用において業界をリードし続けています。 (RecSys) 人々により良い体験を提供するために, 広告主にとってより良い結果が得られます. パフォーマンスの次のフロンティアに到達するために, Meta の Ads Recommender ランタイム モデルを LLM スケールに拡張しています & 人々の興味や意図をさらに深く理解するための複雑さ.
この規模の拡大 & 複雑さが根本的な「推論のトリレンマ」を悪化させる: モデルの複雑さの増大とそれに伴うコンピューティングとメモリの必要性と、数十億人にサービスを提供するグローバル サービスに必要な低遅延とコスト効率のバランスをとるという課題. これを克服するには, 私たちはメタ適応ランキングモデルを開発しました, 高い ROI と業界をリードする効率で推論スケーリング曲線を効果的に曲げます。.
適応型ランキング モデルは、「画一的な」推論アプローチをインテリジェントな推論アプローチに置き換えます。 リクエストルーティング. モデルの複雑さを、人のコンテキストと意図の豊富な理解と動的に調整することによって, システムは、すべてのリクエストが最も効果的な方法で処理されることを保証します。 & 効率的なモデル. これにより、メタ広告は厳密な条件を維持できるようになります。, すべての人に高品質のエクスペリエンスを提供しながら、プラットフォームが依存する 1 秒未満の遅延.
LLM スケールのモデルを Meta の規模で提供するには、推論スタックの根本的な再考が必要でした, 3 つの主要なイノベーションによって推進される:
- 推論効率の高いモデルのスケーリング: リクエスト中心のアーキテクチャへの移行により, 適応型ランキング モデルは LLM スケールに対応します & 1 秒未満のレイテンシでの複雑性モデル, 体験を損なうことなく、人の興味や意図をより高度に理解できるようになります。.
- モデル/システムの共同設計: モデル設計を基盤となるハードウェア システムおよびシリコンの機能と制限に合わせて調整するハードウェア認識モデル アーキテクチャを開発することによって, 適応型ランキング モデルにより、異種ハードウェア環境におけるハードウェア使用率が大幅に向上します.
- 再考されたサービスインフラストラクチャ: マルチカード アーキテクチャとハードウェア固有の最適化を活用, 適応型ランキング モデルにより、O(1T) パラメータのスケーリング, これにより、LLM スケールのランタイム RecSys モデルを前例のない効率で提供できるようになりました。.
LLM スケールのインテリジェンスを広告スタックにさらに統合することで、, 適応型ランキング モデルは、システム全体の計算効率を維持しながら、広告コンバージョンと広告主の価値を大幅に向上させます。. これにより、あらゆる規模の企業に優れたパフォーマンスが保証されます。. 第4四半期にInstagramを開始して以来 2025, 適応型ランキング モデルは、 +3% 広告コンバージョンの増加と +5% ターゲットユーザーの広告クリック率の向上.
メタ適応ランキングモデルの導入
LLM スケールの提供 & リアルタイム広告レコメンデーション環境の複雑性モデルでは、モデルの複雑性とシステム効率の間の根本的な緊張を解決する必要があります. チャットボットなどの LLM アプリケーションとは異なります, ここで、応答時間は秒単位で測定されます, 広告の推奨では 2 つの妥協のない制約を達成する必要があります:
- 遅延はユーザーエクスペリエンスに影響を与えます: 広告は 1 秒未満の遅延で選択され、返される必要があります. 従来、広告の計算を LLM スケール レベル以上に拡張することは、ユーザー エクスペリエンスを損なう遅延の回帰がなければ不可能でした。.
- コスト効率が重要: 単にハードウェアを追加するだけの総当たり的なスケーリングは経済的に持続不可能です. プラスの ROI を達成するには、総コストを増加させることなく、より複雑なモデルを解放する必要があります。.
アダプティブ ランキング モデルは、サービング スタック全体にわたる 3 つのコア イノベーションを活用したパラダイム シフトを通じて、これらの課題に対処します。:
- 推論効率の高いモデルのスケーリング: 適応型ランキングモデル O と同等のモデルの複雑さを実現します。(10 GFLOP) 最上位 LLM が使用するトークンごと. しかし, 標準の LLM 推論よりも 1 桁高速に動作します。, 維持する ○(100 MS) 制限されたレイテンシ.
- ディープモデルシステムの共同設計: 適応型ランキング モデルは、基盤となるハードウェアおよびシリコンと深く共同設計されています; モデルの FLOP 使用率を向上させました (損失) に 35% 複数のハードウェア タイプにわたって.
- 再考されたサービスインフラストラクチャ: 適応型ランキング モデルは、マルチカード GPU サービス インフラストラクチャを利用して、単一デバイスの物理メモリ制限を突破します。. これにより、モデルパラメータを次のようにスケールできるようになります。 ○(1T), providing a depth of understanding of people’s interests and intent previously impossible at Meta’s scale.
これらのイノベーションを統合することで、, すべてのリクエストに対して最も効果的なモデルが使用されることを保証します。これにより、プラットフォーム上の人々に高度にパーソナライズされた広告エクスペリエンスを提供し、システム全体の計算効率を維持しながら広告主の価値を最大化します。.
![写真[2]-メタ適応ランキングモデル: Windows 7、8、10、11 の広告に LLM スケール モデルを提供するために推論スケーリング カーブを曲げる - Winpcsoft.com](https://winpcsoft.com/wp-content/plugins/wp-fastest-cache-premium/pro/images/blank.gif)
推論効率の高いモデルのスケーリング
適応型ランキング モデルは、推論効率を根本的に再定義するモデル システムの革新を導入します。. この変革は 3 つの技術的な柱に基づいて構築されています:
- スケーリングコストを線形から準線形に変換 LLM スケールで大規模な冗長性を排除するリクエスト指向の計算フローに移行することによって.
- 構造スループットの最大化 アーキテクチャの改良により、深いモデルを安定させ、内部ネットワークのボトルネックを最小限に抑える.
- 全体的なレイテンシの最適化により複雑さのオーバーヘッドを中和する, 機能の前処理を GPU にオフロードし、エンドツーエンドの実行パスを合理化します。.
スケーリングコストを線形から準線形に変換
従来のモデルは、各ユーザーと広告のペアを個別に処理します, 大規模な計算冗長性の作成. 適応型ランキング モデルは、リクエスト指向の最適化を通じてこれを排除します。, これにより、広告候補ごとに 1 回ではなく、リクエストごとに 1 回高密度のユーザーシグナルが計算されます。. このシフトは, リクエスト指向の計算共有とカーネル内ブロードキャストの最適化を活用, GPU カーネル内で広告候補間でリクエストレベルの埋め込みを直接共有します。, メモリ帯域幅の圧力を大幅に軽減しながら、スケーリング コストを線形から準線形に変換します。.
これに基づいて構築する, リクエスト指向のシーケンス スケーリングにより、これまではコンピューティングとストレージのコストによって制限されていた長い形式のユーザー動作シーケンスの使用が可能になります。. 計算オーバーヘッドを最小限に抑えるには, 適応型ランキング モデルは、リクエストごとに 1 回大量のシーケンスを処理し、結果をすべての広告候補間で共有します. ストレージを最適化するには, 冗長なデータ レプリケーションを一元的なデータ レプリケーションに置き換えます。, オンザフライでトレーニング データと結合されるユーザー ログの高効率なキー/値ストア. これらの最適化により、地球規模のシステムに必要なサービスとストレージのフットプリントが最小限に抑えられます。.
Wukong Turbo による構造スループットの最大化
その間 リクエスト指向の最適化 計算フローを最適化します, Wukong Turbo は、メタ広告の内部アーキテクチャをランタイムに最適化して進化させたものです。. 上に構築する 悟空の建築 積み重ね可能な因数分解マシンを使用する, シーケンス学習とクロスレイヤーアテンション, Wukong Turbo は、ディープ モデルをスケーリングするときに通常発生する数値の不安定性とネットワーク オーバーヘッドを処理するための特定の改良を導入しています。. 具体的には, バイアスなしのアプローチを採用して不安定な項を削除します, FLOP やパラメータ数を増やすことなくスループットを向上させる. 内部ボトルネックを防ぐには, 小規模なパラメータ委任を利用して、完全にシャード化されたデータ並列からパラメータをオフロードすることで、ネットワークとメモリのオーバーヘッドを削減します。 (FSDP) 分散データへの並列化 (DDP) 線形層の冗長コンポーネントを削減するスパースベースの単純化と並行して. これらの機能強化により、基本アーキテクチャが安定したアーキテクチャに変換されます。, 高性能システム, 1 秒未満の推論バジェットを厳密に保護しながら、モデルの複雑さを拡張できるようにします。.
全体的なレイテンシの最適化により複雑さのオーバーヘッドを中和する
この変換の最終段階では、従来のボトルネックである機能の前処理に対処します。 処理された機能を待機している間、GPU の計算能力が十分に活用されないままになるため、クライアントのメモリ負荷とデータ不足が発生します。. 適応型ランキング モデルは、前処理をクライアント CPU からリモート GPU ホストにオフロードします。, コンパクトなタプルベースのフォーマットと GPU ネイティブ カーネルを利用して、トップ K の複雑さを軽減します。 ○(N ログ N) に ○(N). さらに処理を高速化するには, スレッドプールの競合を排除するために、最適化されたデータ圧縮とクライアントフローの再構築という総合的な戦略を実装しました。. これらの多層最適化により、LLM スケールの遅延ペナルティを中和することに成功しました。 & 複雑, 適応型ランキング モデルにより、Meta のグローバル プラットフォームが必要とする速度でフロンティア レベルのパーソナライゼーションを実現できるようになります。.
モデルとシステムの詳細な協調設計による効率の最大化
Meta Ads は、メタスケールのパフォーマンス制約内で LLM スケールのモデルの複雑さを実現するために、詳細なシステムの協調最適化に依存しています。. モデルとハードウェアの境界を根本から見直すことで, 計算精度とグラフ実行を最適化し、モデルの FLOP 使用率を高めることで計算 ROI を最大化する統合推論スタックを作成しました。 (損失) 異種ハードウェア上で.
選択的 FP8 量子化による高スループット推論
大規模なモデルでは、高スループットの推論を維持するために精度を下げる必要があります, しかし、低精度の量子化を全面的に適用すると、複雑な広告のランキングに必要なニュアンスが損なわれることがよくあります。. 適応型ランキング モデルは、FP8 を選択的に適用するトレーニング後の量子化戦略を通じてこの問題を克服します。. マイクロベンチマークに基づく選択メカニズムの使用, システムは、精度損失耐性が高い層にのみ FP8 をデプロイします。. この的を絞ったアプローチにより、レコメンデーションの品質への影響はごくわずかでありながら、最も複雑なモデルに対して最新の異種ハードウェアのスループットの利点が解き放たれます。.
ハードウェアを意識したグラフとカーネルの特化
冗長なメモリ アクセスと非効率なカーネル起動によって生じる遅延を最小限に抑えるため, 適応型ランキング モデルは、調整されたグラフとカーネルの特殊化を通じて実行フローを最適化します。. 入力を共有する演算子を融合して、高帯域幅メモリとオンチップ SRAM 間のデータ移動を最小限に抑えます。. さらに, グループ化された一般行列乗算や水平融合などの技術を使用して、何千もの小さな操作が計算密度の高いカーネルに統合されます。. 計算グラフと最新の GPU アーキテクチャ間のこの正確な調整により、メモリ フットプリントが大幅に削減され、ハードウェアの効率的な使用率が向上します。, LLM スケールのモデルの複雑さがパフォーマンスに直接反映されるようにする.
LLM スケールの生産の現実に向けたサービス インフラストラクチャの再考
モデルとシステムの協調最適化を超えて, LLM スケールのモデルを大規模に展開するには、基盤となるサービス インフラストラクチャを再考する必要があります. 大規模なレイテンシーペナルティを中和するには, 適応型ランキング モデルは、物理メモリの制限を超え、メタスケールの運用の信頼性を確保するように設計された特殊なスタックを利用します。.
兆パラメータスケール
標準の LLM とは異なります, 推奨モデルは主にスパースによって駆動されます, カテゴリ的特徴. これらの ID を高次元の埋め込みテーブルにマッピングすると、テーブルが大きすぎるとオーバーフィッティングが発生するという重大なトレードオフが生じます。, 一方、サイズが小さいテーブルではハッシュ衝突が発生し、モデルの品質が低下します。. 適応型ランキング モデルにより、O(1T) この緊張を解決するメモリ最適化によるパラメータスケール. システムは、特徴の疎性に基づいてエンベディング ハッシュ サイズを効率的に割り当て、未使用のエンベディングをプルーニングして、厳密なメモリ バジェット内で学習容量を最大化します。. これは統合された埋め込みによってさらに最適化されます, これにより、複数の機能が 1 つのエンベディング テーブルを共有できるようになり、複雑な機能の相互作用を学習する能力を犠牲にすることなく、メモリ フットプリントを大幅に削減できます。.
マルチ GPU カードの組み込みスケーリング
LLM スケールのモデルの埋め込みがテラバイト レベルに近づくにつれて, 単一の GPU のメモリ容量を超えました. これを軽減するには, マルチカード シャーディング メカニズムにより、埋め込みテーブルが最適化されたハードウェア クラスター全体に分散されたセグメントに分割されます。. ハードウェア固有の通信最適化を活用することにより, システムはシャード間の高スループットと効率的な通信を維持します。. このマルチカード アーキテクチャは、シングルカード セットアップと同等のパフォーマンスを実現します。, モデルの複雑さを個々の GPU ハードウェアの制約から効果的に切り離す.
実行時の回復力と信頼性
高トラフィック条件下で数兆パラメータのモデルを提供すると、信頼性に関する重大な課題が生じる, 特に初期化速度とシステムの安定性に関して. 実稼働グレードの信頼性を確保するには, 私たちは、マルチストリーム ダウンロードとリモート キャッシュを利用してモデルをロードする高速モデル ロードを開発しました。 10 分, 導入時のダウンタイムを最小限に抑える. ストリーミング マルチプロセッサの使用率に基づく自動スケーリング ルールにより、システムは変動するトラフィックを動的に処理できます。. これにより、無駄なオーバープロビジョニングを必要とせずに、リアルタイムの需要が確実に満たされます。, プラットフォーム全体で安定性を維持する.
前進する道: 適応型ランキングモデルスタックの進化
Instagram でのアダプティブ ランキング モデルの開始は、推論パフォーマンスとコストのスケーリング曲線をメタスケールで曲げるという私たちの取り組みにおける最初のマイルストーンとなります。. ロードマップは、個別の最適化から、ますます自律的で応答性の高いインフラストラクチャへと移行しています。 リアルタイム グローバルエコシステム全体におけるユーザー信号密度とリクエストパターンの変動.
このビジョンは、より深い複雑性とより長い動作シーケンスを解き放ち、前例のない忠実度でユーザーの意図を捉える進化する推論の効率的なスケーリングから始まりました。. この成長を持続するために, 私たちは推論実行効率の新時代を開拓しています, 高度なモデル圧縮と超低精度の量子化手法を活用して、最も洗練された LLM スケールのモデルを世界の多様なハードウェア フリート全体で効率的に実行できるようにします。.
手作業によるエンジニアリングの従来のボトルネックを解消するには, 私たちはカーネルのパフォーマンスの最適化をさらに加速するためのエージェント最適化フレームワークを検討しています。. これらのフレームワークは、新しいハードウェアとモデル アーキテクチャに自動的に適応します。, 最も洗練された AI が大規模なアクセス可能性とパフォーマンスを維持できるようにする.
さらに, ほぼ瞬時のモデルの新鮮さを通じて学習速度を再イメージしています, インクリメンタルの活用, 定数を達成するためのインプレースウェイト更新, リアルタイム適応. まとめて, これらのイノベーションにより、アダプティブ ランキング モデルが人々のより個人的なエクスペリエンスを強化し続けると同時に、世界中の広告主にとって優れた ROAS を推進できるようになります。.
謝辞
感謝いたします: ジア・ジウン・アン, パン・チェン, チェン・ウェンリン, 丁猫猫, チェンツェ・ファン, ルー・ファン, バーミンガム・グアン, 秦皇, サンタヌ・コライ, アシュウィン・クマール, ジンフ・レン, ボダ・リー, フアユ・リー, リー・ジアウェイ, リー・リー (広告ランキング), リー・リユアン, ミンダ・リー, ウェン・ユアン・リー, ロッキー・リュー, ジェイソン・ルー, ロバート・ルオ, マ・インビン, サンディープ・パンディ, ウラジミール・パシュケヴィチ, ヴァルナ プヴァダ, マイケル・シャオ, プラナフ・シャルマ, 沈子建, ビバ・シンハ, マット・スタイナー, 孫崇林, ウェイマン・サン, アーロン (李波) タオ, ウェイ・シャオハン, ネイサン・ヤン, ヤオ・ヤンタオ, ホンタオ・ユー, 李裕, シハン・ゼン, 張文雲, ビル・チャオ, アレックス・チョン, 周哲恵, ある全体を Vチーム Meta の広告レコメンデーション システムにおける LLM スケール ランタイム モデルの開発と運用を支えるチーム.
