Por Que a Representação Hierárquica de Interesses é Importante

Você já se perguntou como o Meta consegue exibir anúncios relevantes mesmo quando os usuários quase não clicam ou convertem? A resposta está em uma nova área de pesquisa chamada Representação Hierárquica de Interesses (Hierarchical Interest Representation).

O ranking tradicional de deep funnel depende de sinais de engajamento esparsos—alguns cliques, uma compra aqui e ali. Na escala do Meta (bilhões de usuários, milhões de anunciantes), essa esparsidade é um gargalo fundamental.

A Representação Hierárquica de Interesses resolve isso aprendendo uma camada de representação upstream universal sobre todo o ecossistema de anúncios. Ela unifica usuários, anunciantes, produtos e serviços em um único espaço de embeddings. Em vez de tratar cada impressão de anúncio isoladamente, o sistema raciocina sobre relacionamentos de longo alcance em uma estrutura de grafo.

Fonte: Blog de Engenharia do Meta – Explorando a Representação Hierárquica de Interesses para Otimização de Deep Funnel

Meta Hierarchical Interest Representation transformer graph architecture diagram for ads deep funnel optimization IT Technology Image

Arquitetura Principal: Transformer em um Grafo

A Representação Hierárquica de Interesses é construída sobre um grafo heterogêneo tipado, ponderado e com decaimento temporal. Os nós representam usuários, anúncios, anunciantes, campanhas, produtos e pixels. As arestas capturam interações—cliques, visualizações, compras—cada uma com timestamp e tipo de ação.

O Codificador Hierárquico

O codificador é um transformer adaptado para dados de grafo. Inovações principais:

  • Enriquecimento com Conhecimento de Mundo: Características multimodais (texto, imagens, vídeo) dos catálogos dos anunciantes são processadas via LLMs para produzir embeddings iniciais ricos. Isso permite que o modelo entenda o que é um produto, não apenas como os usuários interagem com ele.
  • Codificadores de Estrutura: Um codificador de nós funde tipo de nó, ID de nó controlado por deep hash, conhecimento de mundo e metadados por tipo. Um codificador de posição injeta topologia local via random walk e amostragem priorizada por importância. Um codificador de arestas adiciona tipo, peso e sinais temporais.
  • Composição de Viés: Sinais estruturais do grafo (transições de tipo de nó, distâncias de caminho mais curto) são adicionados como vieses de atenção. Isso torna o modelo consciente da topologia, evitando o problema de over-smoothing comum em GNNs baseadas em message-passing.
  • Atenção com Eficiência de Memória: Usando FlexAttention, os vieses estruturais do grafo são computados on-the-fly—nenhuma matriz de viés completa é materializada. Isso permite escalar para bilhões de nós.
# Pseudocódigo simplificado ilustrando a composição do viés de atenção
import torch
import torch.nn.functional as F

def atencao_hierarquica(query, key, value, viés_aresta, viés_tipo_no):
    """
    query, key, value: [batch, seq_len, d_model]
    viés_aresta: [batch, seq_len, seq_len] – viés estrutural do grafo
    viés_tipo_no: [batch, seq_len, seq_len] – viés de transição de tipo
    """
    scores = torch.matmul(query, key.transpose(-2, -1)) / (key.size(-1) ** 0.5)
    scores = scores + viés_aresta + viés_tipo_no  # injeta estrutura do grafo
    pesos_atencao = F.softmax(scores, dim=-1)
    output = torch.matmul(pesos_atencao, value)
    return output

Treinamento: Destilação Auto-Supervisionada Cross-View

O treinamento usa um esquema teacher-student. Para cada nó âncora, uma visão ampla (teacher) e uma visão estreita (student) são amostradas. O student aprende a prever o mesmo cluster de interesse que o teacher. O balanced assignment de Sinkhorn-Knopp evita o colapso de clusters.

Um cabeçote de predição de engajamento adiciona sinal supervisionado: dadas duas representações de nó, um tipo de engajamento e um tempo, predizer se uma aresta real existe naquele momento. Isso ancora os clusters latentes no comportamento observado do usuário.

Meta production data center server rack powering billion-scale graph neural network training System Abstract Visual

Tokens Bag-of-Meaning: De Embeddings para Unidades Acionáveis

Embeddings contínuos são poderosos para ranking, mas não são adequados para recuperação por índice invertido ou interpretação humana. A Representação Hierárquica de Interesses os discretiza em tokens Bag-of-Meaning (BoM) via quantização composta.

  • Um usuário é representado pelos tokens BoM que descrevem seus interesses.
  • Um anúncio ou anunciante é representado pelos tokens BoM dos interesses que ele atende.

Isso permite recall rápido e compacto para recuperação e aumenta a personalização com sinais de interesse latente.

Desafios Técnicos e Limitações

DesafioMitigaçãoLimitação Restante
Feedback esparso do usuárioDestilação auto-supervisionada de visões amplas do grafoCold-start para segmentos de usuário totalmente novos
Captura de relacionamentos de longo alcanceVieses de atenção estruturais do grafoCusto computacional ainda alto para serving em tempo real
Causalidade temporalCutoff estrito de timestamps, divisão cronológica train/val/testRequer infraestrutura cuidadosa para evitar vazamento de dados
Atualização dos embeddingsMotor de grafo online com treinamento GPU pipelineRetreinamento frequente ainda é caro; fine-tuning eficiente é trabalho futuro

Atenção

A Representação Hierárquica de Interesses é projetada para o ecossistema específico do Meta. Os requisitos de infraestrutura (bilhões de nós, motor de grafo online, kernels de atenção personalizados) são proibitivos para a maioria das organizações. No entanto, as ideias centrais—enriquecimento com conhecimento de mundo, clustering hierárquico, aprendizado auto-supervisionado de grafos—podem ser adaptadas para sistemas de recomendação de menor escala.

Data analysis dashboard showing hierarchical interest clusters and user-ad engagement metrics Software Concept Art

Conclusão e Próximos Passos

A Representação Hierárquica de Interesses é um passo significativo para resolver a esparsidade de sinais em deep funnel de anúncios. Ao unificar usuários, anunciantes e produtos em um único espaço de embeddings enriquecido com conhecimento, ela permite a entrega de anúncios mais relevantes mesmo quando o feedback explícito é raro.

Para equipes de engenharia construindo sistemas similares, os principais aprendizados são:

  1. Enriqueça sinais esparsos com conhecimento de mundo—use LLMs para entender a semântica de produtos e anúncios.
  2. Pense hierarquicamente—clusters de interesse grossos para estabilidade, tokens finos para especificidade.
  3. Invista em infraestrutura de grafos—motores de grafo online com causalidade temporal são essenciais para produção.

Leia a Seguir

Aprofunde-se

  • Estude redes neurais de grafos com PyTorch Geometric ou DGL.
  • Explore métodos de aprendizado auto-supervisionado como SimCLR e BYOL para dados de grafo.
  • Pesquise arquiteturas transformer de larga escala (ex.: Longformer, BigBird) para dependências de longo alcance.
Este conteúdo foi elaborado com o auxílio de ferramentas de IA, com base em fontes confiáveis, e revisado pela nossa equipe editorial antes da publicação. Não substitui o aconselhamento de um profissional especializado.