- Hierarchische Interessenvertretung ist ein Forschungsgebiet für Meta Ads. Wir erforschen eine vorgelagerte Darstellungsebene über dem Universum der Ads-Entitäten – den Nutzern, Werbetreibende, Produkte, Dienste – Erlernen einheitlicher Einbettungen, die die abgeleiteten Interessen der Nutzer mit der Breite dessen verbinden, was Werbetreibende in ihren Deep-Funnel-Anzeigen anbieten.
- Die Innovationen in der hierarchischen Interessenrepräsentation sind ein internes transformatorbasiertes Graphenlernen mit voreingenommener Aufmerksamkeit und selbstüberwachter Cross-View-Destillation, Erlernen multihierarchischer Interessendarstellungen in einem großen Diagramm.
- Hierarchical Interest Representation verbindet reales Wissen mit Engagement-Signalen – multimodale Werbetreibende- und Produktinhalte, die über LLMs verarbeitet werden, bereichern spärliche Interaktionen, Ermöglicht die Verallgemeinerung auf seltene und unsichtbare Einheiten.
- Hierarchical Interest Representation gibt universelle Einbettungen für Anzeigenentitäten und Bag-of-Meaning-Interessen-Tokens aus, die das Potenzial haben, neue Personalisierungen voranzutreiben, Abruf, Aufsicht, und spezielle Ranking-Architekturen im gesamten Anzeigenstapel.
- Durchgängiges Training anhand echter Meta-Anzeigendaten im Maßstab von Milliarden von Interaktionen.
Hierarchische Interessenvertretung ist eine vorgelagerte Darstellungsschicht Entwickelt, um die Deep-Funnel-Ranking-Optimierung von Meta zu verbessern. Ziel ist es, Unternehmen mit den Menschen auf unseren Plattformen zu verbinden, die die authentischsten Inhalte anbieten, latentes Interesse an dem, was sie anbieten. Das System soll im gesamten Empfehlungsökosystem von Meta funktionieren, wie Metas Generatives Anzeigenmodell (JUWEL), Andromeda, und die Adaptives Ranking-Modell, um die Deep-Funnel-Optimierung voranzutreiben.
Menschen nutzen die Apps und Plattformen von Meta, um mit Menschen und Inhalten in Kontakt zu treten, Mit jeder Schriftrolle drückt man seine Präferenz aus. Engagement-Signale werden verwendet, um sowohl abgeleitete als auch explizite Interessen zu verstehen und die Relevanz von Inhalten auf unseren Plattformen zu verbessern. Der Einsatz von Frontier AI, um latente Interessen aus spärlichen Engagement-Signalen abzubilden und sie mit der riesigen Angebotslandschaft von Werbetreibenden abzugleichen, ist ein transformativer Ansatz, um den Herausforderungen der Signalknappheit zu begegnen und die Leistung von Deep-Funnel-Anzeigen zu steigern.
Die Mission besteht darin, die Argumentationsbeziehungen in der gesamten Landschaft der Anzeigeneinheiten – benutzerübergreifend – zu stärken, Unternehmen, und Produkte – unter Verwendung multihierarchischer Granularitäten, die es unseren Modellen ermöglichen, zwischen stabilen zu navigieren, hochrangige Interessenverankerungen und Fachkräfte, spärliche Signale einer tiefen Trichterabsicht.
Wie die hierarchische Interessenvertretung die Deep-Funnel-Optimierung verbessert
Die hierarchische Interessenrepräsentation bereitet einen strukturellen Wandel in der Repräsentationsmodellierung vor, indem sie durch weiträumige Diagrammtopologien navigiert und spärliche Interaktionssignale in einheitliche Interessencluster mit verschiedenen Granularitäten destilliert. Durch die Verbindung von realem Wissen mit einem semantischen Verständnis der beworbenen Produkte, Es stärkt effektiv die Verbindung zwischen Anzeigen und Benutzerabsichten.
Hierarchische Interessenvertretung fördert entdeckungsorientierte Werbeerlebnisse, indem stabile Interessenanker aus umfangreichen Engagement-Datensätzen extrahiert und in der multimodalen Weltwissensanreicherung verankert werden. Dies zielt darauf ab, die Bereitstellung relevanterer Anzeigeninhalte zu ermöglichen, um Deep-Funnel-Anzeigen zu optimieren.
Die technischen Herausforderungen
Die Benutzerinteraktion mit Anzeigeneinheiten ist natürlich diagrammstrukturiert: Benutzer und Anzeigeneinheiten (Werbetreibende, Produkte, Dienstleistungen, Kampagnen usw.) sind Knoten, und die sie verbindenden Aktivitäten und Ereignisse sind Kanten. Auf der Skala von Meta, Dies ist eines der größten Graphnetzwerke der Branche. Das Erlernen der Interessenvertretung birgt folgende Herausforderungen:
Vom Benutzer abgeleitete Signaldynamik
Meta stellt Benutzern Tools zur Verfügung, mit denen sie ihre Erfahrungen individuell anpassen können, Geben Sie beispielsweise „Interessiert/Nicht interessiert“-Feedback zu Beiträgen, die sie sehen. Zusätzlich, Auf Engagement-Signalen basierende abgeleitete Interessen spielen weiterhin eine wichtige Rolle für die Verbesserung von Deep-Funnel-Anzeigen.
Große Netzwerke mit spärlichen Verbindungen:
Jeden Monat, Das Anzeigennetzwerk von Meta liefert Millionen von Anzeigen, von Millionen von Werbetreibenden, an Milliarden von Menschen auf unseren Plattformen. Dieser „Wortschatz“ ist zwar groß, Die Möglichkeiten für Anzeigenimpressionen sind begrenzt und das Feedback von Deep-Funnel-Benutzern ist rar.
Große Reichweite, Globale Beziehungen
Angesichts der spärlichen Verteilung der einzelnen Verbindungen im tiefen Trichter, Es ist nützlich, allgemeine Muster aus großer Entfernung zu beobachten, Zeichnen Sie verbundene Entitäten und Benutzer grafisch auf und kodieren Sie sie in eine Darstellung. Die Erfassung weitreichender Beziehungen innerhalb großer Graphnetzwerke ist rechenintensiv. Auch wenn die Hardwarefunktionen skalieren, Das Streben nach Modellierungsgenauigkeit erfordert die Entwicklung speichereffizienter Aufmerksamkeitskerne und leistungsstarker Lernalgorithmen.
Einführung der hierarchischen Interessenvertretung
Unser neuestes Forschungsgebiet ist eine vorgelagerte Repräsentationsschicht für universelles Lernen, relationale Wissensdarstellungen von Benutzern und Anzeigeneinheiten. Die Darstellungen erfassen die Interaktionsmuster der Nutzer mit Anzeigen, die Semantik der realen Welt absorbieren, und kaskadieren durch mehrere hierarchische Granularitäten in Latentraumprojektionen auf jeder Ebene. Basierend auf der Diagrammdatenstruktur, Vier Designeigenschaften steuern das System durchgängig:
Dimensionsreduzierung
Die hierarchische Interessendarstellung projiziert einen Rohgraphen in einen konfigurierbaren Supergraphen, wobei jeder Superknoten ein erlerntes latentes Interessenprimitiv ist. Benutzeranzeigenkanten, die im Rohdiagramm dünn besiedelt sind, werden im Diagramm des primitiven Interesses deutlich dichter. Von Natur aus, Der primitive Zinsgraph ist im Wortschatz stationärer und stabiler, auch wenn das Anzeigengeschäft dynamischer ist.
Wissensanreicherung
Hierarchische Interessenvertretung bereichert heterogene Einheiten, insbesondere Werbetreibende und Produkttypen, mit multimodalen Inhaltsmerkmalen wie Text, Bilder, und Video. Diese Funktionen werden aus strukturierten Seitenmetadaten und Werbekatalogattributen abgerufen und durch Vision- oder Sprachmodelle verarbeitet. Diese zusätzlichen Informationen ergänzen vorhandene Engagement-Daten. Anstatt nur zu wissen wie Benutzer interagieren mit etwas, es fängt ein was das für ein Ding eigentlich ist. Selbst bei Unternehmen, die es noch nie zuvor gesehen hat, versteht es die zugrunde liegenden Geschäfte und Produkte.
Einheitliche relationale Darstellung
Hierarchische Interessenvertretung lernt gründliche Wissensdarstellung für Benutzer und Entitäten, zusammen mit ihren latenten Interessenprimitiven Darstellung in einem einzigen metrischen Raum. Es kann auf die Gegenseitigkeit von Entitäten schließen Beziehung und Affinitäten über oder innerhalb von Typen. Verwendung von Einbettungsoperationen, Die hierarchische Interessendarstellung kann Primitiv-zu-Primitiv- und Cluster-zu-Cluster-Beziehungen bestimmen. Es kann auch die Nähe des Benutzers zu interessierenden Grundelementen abschätzen; wie genau eine Anzeige/ein Werbetreibender bestimmte Interessengrundelemente bedient; und was sind die ähnlichen Benutzer, Anzeigen, und Produkte, die nächste Nachbarn sind.
Multihierarchische Granularitäten
Angesichts der insgesamt spärlichen Menge an Deep-Funnel-Informationen, Es gibt einen Kompromiss darüber, wie man in primitive Interessen projiziert. Dichte und stabile Beziehungen implizieren normalerweise eine gröbere Abstraktion auf höherer Ebene, während spärliche und spezifische Verbindungen eine feinere Abstraktionsebene betrachten. Hierarchische Interessenvertretung lernt Supergraphen, die durch mehrere kaskadieren hierarchisch Schichten für diese Flexibilität, Anpassung an die Ranking-Modellierungsarchitektur, Personalisierung, oder Abrufanwendungen.
Die hierarchische Interessenvertretungsarchitektur
Hierarchical Interest Representation erstellt Darstellungen, indem es weltweites Wissen über Werbetreibende und Produkte mit direkten zeitlichen Interaktionsdaten des Benutzers kombiniert. Seine LLM-inspirierte Transformatorarchitektur wird auf große Diagramme angewendet, spärliche Aufmerksamkeit verwenden, um langfristige Beziehungen zu erfassen. Das System ist darauf ausgelegt, verschiedene Anwendungen auf der gesamten Anzeigenplattform vom Abruf bis zum endgültigen Ranking zu unterstützen.
![Bild[1]-Erkundung der hierarchischen Interessendarstellung für Meta-Anzeigen, Deep-Funnel-Optimierung für Windows 7,8,10,11-Winpcsoft.com](https://winpcsoft.com/wp-content/plugins/wp-fastest-cache-premium/pro/images/blank.gif)
In den folgenden Abschnitten wird der architektonische Entwurf jeder Komponente innerhalb des hierarchischen Interessenvertretungssystems detailliert beschrieben.
Angereichertes Engagement-Diagramm
Heterogene Graphstruktur
Die hierarchische Interessenvertretung basiert auf einer typisierten, gewichtet, Zeitverfalldiagramm, das mehrere Entitätstypen – Benutzer – vereint, Anzeigen, Werbetreibende, Kampagnen, Produkte, und Pixel. Diese Entitäten sind durch typisierte Interaktionskanten verbunden, darunter Unternehmen, die Anzeigenartefakte erstellen, und die Interaktion zwischen Nutzern und Anzeigen. Jede Kante trägt ihren Aktionstyp und Zeitstempel, der die Aktualitätsabsicht gegen das langfristige Interesse abwägt. Dies getippt, Die heterogene Struktur ermöglicht es einer einzelnen nachgelagerten Vertretung, über den Lebensstil einer Person zu urteilen, Die Katalogreichweite eines Werbetreibenden, und die Produkte, die sie verbinden – alles in einem einheitlichen Raum.
Skalierung auf Meta-Produktionsdaten
Die Grafik umfasst Milliarden von Benutzern, Entitäten und ihre Interaktionen auf monatlicher Basis, diente sowohl online für die Aktualität der Produktion als auch offline für die Evaluierung und schnelle Iteration. Jeder Knoten verfügt über umfangreiche anfängliche Einbettungen, die vorab trainierte semantische Merkmale mit Verhaltensstatistiken verbinden. Häufige Knoten fügen über Deep-Hash-Einbettungen eine lernbare ID-Einbettung hinzu, ein kleines gemeinsames neuronales Netzwerk, das auf einen Vektor von Hashes der Knoten-ID angewendet wird, Halten Sie den ID-Speicher begrenzt, während das Vokabular auf mehrere zehn Milliarden anwächst.
Hierarchischer Encoder
Ein transformatorbasierter hierarchischer Encoder ist unser Modellierungsdesign, um das Darstellungslernen bei dieser gigantischen Diagrammgröße zu skalieren. Es wurden mehrere bedeutende technische Entwürfe berücksichtigt.
![Bild[2]-Erkundung der hierarchischen Interessendarstellung für Meta-Anzeigen, Deep-Funnel-Optimierung für Windows 7,8,10,11-Winpcsoft.com](https://winpcsoft.com/wp-content/plugins/wp-fastest-cache-premium/pro/images/blank.gif)
Weltwissen
Weltwissen dient als Mittel, um die gegebenen Punkte zu verbinden, was auf relativ stationären Einheiten reichlich vorhanden ist, wie etwa Werbetreibende, Produkte, usw. Wir rufen die multimodalen Informationen im zusammenfassenden Text ab, Bilder, und Video und verarbeiten Sie es durch eine angepasste LLM-Inferenz-Engine, die codierte Feature-Eingaben für unser Repräsentationslernen erzeugt.
Strukturkodierer
Die Eingabeschicht des hierarchischen Encoders kombiniert umfangreiche komplementäre Encoder. Ein Node-Encoder verschmilzt den Node-Typ, Deep-Hash-kontrollierte Knoten-ID, Weltwissensfunktionen, und pro Typ Metadaten/Funktionen, sodass jeder Knoten sowohl mit seiner semantischen Identität als auch mit seinem realen Inhalt in das Lernmodell eintritt. Ein Positionsencoder wendet eine Positionskodierung auf die abgetastete Ansicht aus dem Diagramm an, um eine lokale Topologie mit Zufallswanderung zu injizieren, Wichtigkeitspriorisierte Strategien. Ein Kantenencoder bereitet den Kantentyp vor, Kantengewicht und zeitliche Signale fließen in den Aufmerksamkeitslernmechanismus ein.
Voreingenommene Zusammensetzung
Transformatoren messen paarweise Beziehungen zwischen Token durch Aufmerksamkeit. Grafiken, durch Konstruktion, kodieren paarweise Beziehungen zwischen Knoten. Diese beiden Ideen ergänzen sich natürlich. Graphstrukturelle Signale (wie knotenartige Übergänge entlang von Ereigniskanten und kürzeste Pfadentfernungen für lokale Konnektivität) Geben Sie das Modell als Aufmerksamkeitsverzerrungen ein, die das Abfrage-Schlüssel-Skalarprodukt in jeder Ebene erweitern.
Dies macht das Modell topologiebewusst. Anstatt einen Untergraphen als eine Menge Knoten zu behandeln, Der hierarchische Encoder verfügt über explizites Wissen darüber, wie Knoten strukturell miteinander verbunden sind, Erfassen weitreichender Beziehungen, die durch die normale Nachrichtenübermittlung tendenziell übermäßig geglättet werden.
Achtung Kernel
Das Hinzufügen graphstruktureller Verzerrungen zur Aufmerksamkeit ist normalerweise kostspielig: Die Standardimplementierung materialisiert eine vollständige paarweise Bias-Matrix, Erzwingen eines Rückzugs von der gedächtniseffizienten Aufmerksamkeit. Wir übernehmen FlexAttention, Dadurch wird jeder Bias-Term im laufenden Betrieb berechnet, sodass die paarweise Matrix niemals realisiert wird. Untergraphen variabler Länge werden in eine einzelne blockmaskierte Sequenz gepackt, Vermeidung von Füllabfall und Querlecks im Diagramm. Neue Bias-Begriffe werden als kleine Bewertungsregeln eingesetzt, Es sind keine Low-Level-Kernel-Arbeiten erforderlich. Das Ergebnis ist eine gedächtniseffiziente Aufmerksamkeit mit vollständigem Verständnis der Graphstruktur.
Training des hierarchischen Encoders
Cross-View-Destillation
Der hierarchische Encoder wird mit Selbstüberwachung durch ein paarweises Lehrer-Schüler-Schema trainiert. Für jeden Ankerknoten, Wir probieren eine breite Sichtweise des Lehrers und eine eingeschränkte Sichtweise der Schüler aus, beide durchlaufen den hierarchischen Encoder. Der Schüler wird darin geschult, die gleichen Interessengruppen vorherzusagen wie der Lehrer. Weil der Lehrer eine umfassendere Sicht auf das Diagramm sieht, seine Vorhersage ist sicherer, Geben Sie dem Schüler ein klares, passendes Ziel. Dadurch wird die Überwachung weit über den kleinen Teil der Benutzer hinaus ausgedehnt, die Deep-Funnel-Conversions erzeugen, einen Großteil des spärlichen Engagements anzugehen, das die hierarchische Interessenvertretung motivierte. Die ausgewogene Sinkhorn-Knopp-Zuweisung verhindert den Zusammenbruch einzelner Cluster, ein bekannter Fehlermodus selbstüberwachter Methoden.
Engagement-Vorhersage
Die Selbstdestillation entdeckt die latenten Interessenprimitiven des Graphen, indem sie dem Modell beibringt, dass verschiedene Ansichten desselben Knotens zusammen gruppiert werden sollten. Die Engagement-Vorhersage ergänzt das ergänzende überwachte Ziel – bei zwei Knotendarstellungen, ein Engagement-Typ, und eine Zeit, vorhersagen, ob zu diesem Zeitpunkt ein echter Eingriffsvorsprung besteht. Zusammen, Sie geben der hierarchischen Interessenrepräsentation sowohl ansichtsinvariante strukturelle Prioritäten als auch eine direkte Grundlage im beobachteten Benutzerverhalten, Umwandlung in eine allgemeine Bewertungsfunktion für den gesamten Lieferstapel.
Online-Graph-Infrastruktur
Der rohe heterogene Graph basiert auf der Online-Graph-Engine von Meta. Die gleiche Datenquelle unterstützt sowohl die Schulung als auch die Online-Bereitstellung, Sicherstellung der gleichen Verteilung auf beide. Zum Training, Subgraph-Abrufe und Knoten-Feature-Lesevorgänge werden mit GPU-Rechnern gepipelinet. Mehrere Arbeiter bereiten parallel kommende Chargen vor, während das Modell mit der aktuellen trainiert, Versteckt die Datenladelatenz hinter den Vorwärts- und Rückwärtsdurchgängen. Während der Testphase, Dadurch wurde eine 30-fache Beschleunigung gegenüber der synchronen Basislinie erreicht und die Auslastung der GPU-Modell-FLOPs hoch gehalten. Die bitgenaue Reproduzierbarkeit bleibt durchgängig erhalten, Daher verändern Infrastrukturmigrationen und Checkpoint-Wiederherstellung niemals stillschweigend das Modellverhalten.
Kausalität
Um Informationslecks zu verhindern, Training und Evaluation respektieren strikt die zeitliche Reihenfolge der Ereignisse. Die Graph-Engine wendet bei jedem Aufruf einen Cutoff-Zeitstempel an und maskiert alle Knoten oder Kanten, die nach diesem Zeitpunkt datiert sind.
Die Kanten sind chronologisch in Züge unterteilt, Validierung, und Testfenster. Stapel werden nur innerhalb fester Zeitabschnitte gemischt, Geben Sie dem Optimierer Gradientenvielfalt, ohne zeitliche Grenzen zu überschreiten. Das Modell lernt nur aus Informationen, die zu diesem Zeitpunkt verfügbar gewesen wären, Genauigkeitsgewinne spiegeln also echtes Lernen wider und nicht zukünftige Verluste.
Tokenisierung
Beutel voller Bedeutungsmarken
Kontinuierliche universelle Einbettungen sind für das Ranking von großer Bedeutung, Sie eignen sich jedoch nicht von Natur aus für das Abrufen mit invertierten Indizes, Aggregation festlegen, oder menschliche Interpretation. Wir diskretisieren sie in Bag-of-Meaning (BoM) Token – ein Kompakt, ungeordnetes Vokabular interessanter Konzepte, die durch zusammengesetzte Quantisierung erzeugt werden. Ein Benutzer wird durch die BoM-Token repräsentiert, die seine Interessen beschreiben. Eine Anzeige oder ein Werbetreibender wird durch die BoM-Tokens der Interessen repräsentiert, denen sie dienen.
Aktivieren der hierarchischen Interessenvertretung im gesamten Lieferstapel
Die hierarchische Interessendarstellung ist darauf ausgelegt, erlernte Interessendarstellungen in den Anzeigenbereitstellungsstapel einzubinden, um schließlich das Deep-Funnel-Ranking über bestehende Komponenten wie GEM hinweg zu verbessern, Andromeda, und das adaptive Ranking-Modell. Zum Beispiel, BoM-Tokens erweitern die auf Engagement basierende Personalisierung und Überwachung mit latentem Benutzerinteresse, und schnell aktivieren, Kompakter Rückruf zum Abrufen mit invertierter Indexsuche. Die multihierarchische Struktur der Hierarchical Interest Representation unterstützt spezialisierte Architekturen, wie Mixture of Experts generatives Verteilungslernen, das nach Superinteressenkategorien geleitet wird, und ermöglicht hierarchisches Denken über stabile Interessenanker für die Nutzer-Anzeigen-Affinität.
Die Zukunft der hierarchischen Interessenvertretung
Wir werden die Effizienz der Schulungsskalierung weiter vorantreiben, Frische einbetten, Wissenskomprimierung, und gedächtniseffiziente Aufmerksamkeitskerne für eine größere Darstellungsausdruckskraft. Wir untersuchen auch Parametereffizienz, objektive bedingte Feinabstimmung der vorgelagerten hierarchischen Interessenvertretung, Ermöglicht eine Spezialisierung auf Segmentebene für heterogene Deep-Funnel-Optimierungsziele auf der Grundlage eines gemeinsamen Encoders.
Danksagungen
Wir möchten uns bedanken Sammy Bald, Shaoqing Yuan, Chuan Hu, Chris Hayduk, Wenfan Xu, Liang Xu, Piyush Dak, Ikhiro Ihara, Ashish Kalbhor, Manjari Jha, Priya Krishnamurthy, Xulei Liu, JC Lyu, Yuqi Bi, Vivek Bitla, Krishna Polen, Jiayin Ge, Santanu Kolay, Matt Steiner, Sandeep Pandey, Gunjit Singh, Marvin Kim und das gesamte Team hinter der Entwicklung und Produktion des Hierarchical Interest Representation Project.
