Por Que a Representação Hierárquica de Interesses é Importante
Você já se perguntou como o Meta consegue exibir anúncios relevantes mesmo quando os usuários quase não clicam ou convertem? A resposta está em uma nova área de pesquisa chamada Representação Hierárquica de Interesses (Hierarchical Interest Representation).
O ranking tradicional de deep funnel depende de sinais de engajamento esparsos—alguns cliques, uma compra aqui e ali. Na escala do Meta (bilhões de usuários, milhões de anunciantes), essa esparsidade é um gargalo fundamental.
A Representação Hierárquica de Interesses resolve isso aprendendo uma camada de representação upstream universal sobre todo o ecossistema de anúncios. Ela unifica usuários, anunciantes, produtos e serviços em um único espaço de embeddings. Em vez de tratar cada impressão de anúncio isoladamente, o sistema raciocina sobre relacionamentos de longo alcance em uma estrutura de grafo.
Fonte: Blog de Engenharia do Meta – Explorando a Representação Hierárquica de Interesses para Otimização de Deep Funnel
![]()
Arquitetura Principal: Transformer em um Grafo
A Representação Hierárquica de Interesses é construída sobre um grafo heterogêneo tipado, ponderado e com decaimento temporal. Os nós representam usuários, anúncios, anunciantes, campanhas, produtos e pixels. As arestas capturam interações—cliques, visualizações, compras—cada uma com timestamp e tipo de ação.
O Codificador Hierárquico
O codificador é um transformer adaptado para dados de grafo. Inovações principais:
- Enriquecimento com Conhecimento de Mundo: Características multimodais (texto, imagens, vídeo) dos catálogos dos anunciantes são processadas via LLMs para produzir embeddings iniciais ricos. Isso permite que o modelo entenda o que é um produto, não apenas como os usuários interagem com ele.
- Codificadores de Estrutura: Um codificador de nós funde tipo de nó, ID de nó controlado por deep hash, conhecimento de mundo e metadados por tipo. Um codificador de posição injeta topologia local via random walk e amostragem priorizada por importância. Um codificador de arestas adiciona tipo, peso e sinais temporais.
- Composição de Viés: Sinais estruturais do grafo (transições de tipo de nó, distâncias de caminho mais curto) são adicionados como vieses de atenção. Isso torna o modelo consciente da topologia, evitando o problema de over-smoothing comum em GNNs baseadas em message-passing.
- Atenção com Eficiência de Memória: Usando FlexAttention, os vieses estruturais do grafo são computados on-the-fly—nenhuma matriz de viés completa é materializada. Isso permite escalar para bilhões de nós.
# Pseudocódigo simplificado ilustrando a composição do viés de atenção
import torch
import torch.nn.functional as F
def atencao_hierarquica(query, key, value, viés_aresta, viés_tipo_no):
"""
query, key, value: [batch, seq_len, d_model]
viés_aresta: [batch, seq_len, seq_len] – viés estrutural do grafo
viés_tipo_no: [batch, seq_len, seq_len] – viés de transição de tipo
"""
scores = torch.matmul(query, key.transpose(-2, -1)) / (key.size(-1) ** 0.5)
scores = scores + viés_aresta + viés_tipo_no # injeta estrutura do grafo
pesos_atencao = F.softmax(scores, dim=-1)
output = torch.matmul(pesos_atencao, value)
return output
Treinamento: Destilação Auto-Supervisionada Cross-View
O treinamento usa um esquema teacher-student. Para cada nó âncora, uma visão ampla (teacher) e uma visão estreita (student) são amostradas. O student aprende a prever o mesmo cluster de interesse que o teacher. O balanced assignment de Sinkhorn-Knopp evita o colapso de clusters.
Um cabeçote de predição de engajamento adiciona sinal supervisionado: dadas duas representações de nó, um tipo de engajamento e um tempo, predizer se uma aresta real existe naquele momento. Isso ancora os clusters latentes no comportamento observado do usuário.

Tokens Bag-of-Meaning: De Embeddings para Unidades Acionáveis
Embeddings contínuos são poderosos para ranking, mas não são adequados para recuperação por índice invertido ou interpretação humana. A Representação Hierárquica de Interesses os discretiza em tokens Bag-of-Meaning (BoM) via quantização composta.
- Um usuário é representado pelos tokens BoM que descrevem seus interesses.
- Um anúncio ou anunciante é representado pelos tokens BoM dos interesses que ele atende.
Isso permite recall rápido e compacto para recuperação e aumenta a personalização com sinais de interesse latente.
Desafios Técnicos e Limitações
| Desafio | Mitigação | Limitação Restante |
|---|---|---|
| Feedback esparso do usuário | Destilação auto-supervisionada de visões amplas do grafo | Cold-start para segmentos de usuário totalmente novos |
| Captura de relacionamentos de longo alcance | Vieses de atenção estruturais do grafo | Custo computacional ainda alto para serving em tempo real |
| Causalidade temporal | Cutoff estrito de timestamps, divisão cronológica train/val/test | Requer infraestrutura cuidadosa para evitar vazamento de dados |
| Atualização dos embeddings | Motor de grafo online com treinamento GPU pipeline | Retreinamento frequente ainda é caro; fine-tuning eficiente é trabalho futuro |
Atenção
A Representação Hierárquica de Interesses é projetada para o ecossistema específico do Meta. Os requisitos de infraestrutura (bilhões de nós, motor de grafo online, kernels de atenção personalizados) são proibitivos para a maioria das organizações. No entanto, as ideias centrais—enriquecimento com conhecimento de mundo, clustering hierárquico, aprendizado auto-supervisionado de grafos—podem ser adaptadas para sistemas de recomendação de menor escala.

Conclusão e Próximos Passos
A Representação Hierárquica de Interesses é um passo significativo para resolver a esparsidade de sinais em deep funnel de anúncios. Ao unificar usuários, anunciantes e produtos em um único espaço de embeddings enriquecido com conhecimento, ela permite a entrega de anúncios mais relevantes mesmo quando o feedback explícito é raro.
Para equipes de engenharia construindo sistemas similares, os principais aprendizados são:
- Enriqueça sinais esparsos com conhecimento de mundo—use LLMs para entender a semântica de produtos e anúncios.
- Pense hierarquicamente—clusters de interesse grossos para estabilidade, tokens finos para especificidade.
- Invista em infraestrutura de grafos—motores de grafo online com causalidade temporal são essenciais para produção.
Leia a Seguir
- Além do Modelo: Como a Pantone Construiu uma Base de Dados Pronta para IA para Criatividade Agêntica
- Privacidade por Design: Como o Airbnb Construiu Funcionalidades Sociais Sensíveis ao Contexto sem Sacrificar a Confiança
Aprofunde-se
- Estude redes neurais de grafos com PyTorch Geometric ou DGL.
- Explore métodos de aprendizado auto-supervisionado como SimCLR e BYOL para dados de grafo.
- Pesquise arquiteturas transformer de larga escala (ex.: Longformer, BigBird) para dependências de longo alcance.