Por que a Classificação de Ativos é a Base da Privacidade

Na era dos produtos nativos de IA, os dados fluem por pipelines, viram features e alimentam modelos. Mas antes de aplicar políticas de retenção, acesso ou anonimização, você precisa saber o que são seus dados. Um campo chamado age pode ser a idade de uma pessoa ou um TTL de cache. Errar nisso pode causar restrições falsas ou deixar lacunas de proteção.

A revisão manual tradicional não acompanha o volume e a velocidade da transformação de dados impulsionada por IA. Por isso, o time de Infraestrutura Consciente de Privacidade (PAI) do Meta desenvolveu um padrão híbrido: use LLMs para ambiguidade, mas destile comportamento estável em regras determinísticas e versionadas para aplicação rotineira.

Isso não é sobre "LLMs em todo lugar". É sobre construir um sistema que aprende com sinais ambíguos, mantendo decisões de produção rápidas, reproduzíveis e auditáveis.

Privacy-aware infrastructure concept with data classification and access control locks IT Technology Image

O Padrão: Contexto, Funil e Destilação

1. Comece com um Contrato

Defina um contrato de classificação pequeno e explícito. Para cada ativo, retorne categoria, pontuação de confiança, rastreamento de decisão e informações de versão. Evite taxonomias universais; cada classificador possui uma pergunta específica.

2. Construa Contexto Antes de Perguntar

A maioria das falhas de classificação são falhas de contexto, não de prompt. Crie um brief de evidências com sinais de apoio, sinais contraditórios e proveniência. Mascare campos circulares para evitar que o modelo "descubra" a resposta.

# Exemplo: Construindo um brief de evidências (simplificado)
def build_evidence_brief(asset):
    sinais = []
    # Buscar linhagem, referências de código, propriedade e anotações semânticas
    linhagem = get_lineage(asset.id)
    refs_codigo = resolve_code_references(asset.field_name)
    propriedade = get_ownership(asset.id)
    semantico = get_semantic_annotation(asset.field_name)
    
    # Adicionar sinais de apoio/contradição com pesos
    if linhagem.conecta_pipeline_usuario:
        sinais.append({"tipo": "apoio", "sinal": "linhagem", "peso": 0.8})
    if semantico.tipo == "EMAIL":
        sinais.append({"tipo": "apoio", "sinal": "semantico", "peso": 0.9})
    if propriedade.time == "infraestrutura":
        sinais.append({"tipo": "contradicao", "sinal": "propriedade", "peso": 0.3})
    
    # Mascarar campos circulares
    mascarado = mask_existing_label(asset)
    
    return {"sinais": sinais, "campos_mascarados": mascarado}

3. Use um Funil de Decisão

Roteie ativos por um funil determinístico primeiro. Se uma regra versionada corresponder, retorne a decisão. Caso contrário, use o LLM. Em produção, ~85% do tráfego é resolvido por regras determinísticas em milissegundos, com o LLM lidando com os ~15% restantes a um custo maior.

# Lógica do funil de decisão
def classificar(asset):
    regra = match_rule(asset)
    if regra:
        return regra.decisao
    evidencia = build_evidence_brief(asset)
    resultado_llm = call_llm(evidencia)
    return resultado_llm

4. Mantenha o Loop de Aprendizado Seguro

Separe rótulos de referência (revisados por humanos) da otimização. Use um painel multi-juiz com três avaliações LLM independentes para validar decisões. Acompanhe a concordância inter-avaliadores (kappa de Cohen) para detectar problemas de qualidade.

Data analyst reviewing lineage and context signals for asset classification Developer Related Image

O que Aprendemos: Armadilhas e Melhores Práticas

  • Contexto supera prompt: Adicionar resolução de código e linhagem corrigiu um falso positivo em um campo age que era um TTL de cache, não a idade de uma pessoa.
  • Determinismo significa reprodutibilidade: Regras e prompts versionados permitem reproduzir decisões para auditorias.
  • Acurácia sozinha é enganosa: Use métricas balanceadas como F1 macro e recall por classe para expor falhas em classes raras.
  • Cobertura não é correção: Acompanhe cobertura junto com recall para evitar regressões.
  • Autorregulação é arquitetural: Construa um controlador de ajuste que pode pausar ou diagnosticar quando a qualidade cair.

Limitações e Próximos Passos

Este padrão não é uma bala de prata. Requer investimento significativo em engenharia de contexto e avaliação. O fallback de LLM pode ser caro e lento. Para times iniciantes, foque em construir um mesh de contexto forte e um contrato claro antes de otimizar prompts.

Em seguida, explore aplicar este padrão a outros fluxos de privacidade, como validação de linhagem, verificação de limites de propósito e atribuição de política de retenção. Os princípios também generalizam para observabilidade e supervisão de agentes.

AI model reasoning over evidence brief to classify data assets Dev Environment Setup

Conclusão: Construa para a Era Nativa de IA

O estudo de caso de classificação de ativos do Meta mostra que infraestrutura consciente de privacidade pode ser uma força motriz para melhor arquitetura. Ao combinar raciocínio de LLM com regras determinísticas, você obtém um sistema seguro, escalável e auditável.

Comece pequeno: defina um contrato claro, construa contexto rico e deixe regras determinísticas lidarem com a rotina. Use LLMs para casos ambíguos e sempre mantenha revisão humana para decisões de alto risco.

Para conhecimento básico, confira nosso guia de Python e Data Commons MCP no Google Cloud.

Este conteúdo foi elaborado com o auxílio de ferramentas de IA, com base em fontes confiáveis, e revisado pela nossa equipe editorial antes da publicação. Não substitui o aconselhamento de um profissional especializado.