Analytics

Uma pessoa, 82 registros: como a qualidade de dados transforma bases fragmentadas em ativos confiáveis

82 registros de origem convergindo para um único golden record

Em uma base central com 32,5 milhões de registros de pessoas, uma busca simples por um nome revelou o tamanho do problema: um mesmo indivíduo aparecia 82 vezes, com grafias, datas de nascimento e documentos divergentes. Não era fraude nem erro isolado. Cada registro estava correto para o sistema que o criou; o problema só aparecia quando alguém tentava enxergar a pessoa inteira.

O caso abre o white paper Uma pessoa, 82 registros, em que a Vert Analytics reúne aprendizados de projetos recentes de qualidade e governança de dados em organizações de grande porte do setor público brasileiro, com bases que vão de dezenas de milhões a bilhões de registros. Nomes de clientes foram omitidos e os dados pessoais do documento são fictícios.

Por que dado ruim custa caro mesmo sem aparecer no orçamento?

Ninguém aprova verba para “dados duplicados”, mas a conta é paga todos os dias: no analista que passa a manhã conciliando planilhas, na investigação que não conecta dois registros da mesma pessoa, no indicador que conta o mesmo cidadão três vezes. O Gartner estima que a baixa qualidade de dados custa, em média, pelo menos US$ 12,9 milhões por ano a cada organização. Na pesquisa global da McKinsey, executivos relataram que 30% do tempo das equipes ia para tarefas sem valor causadas por dados ruins ou indisponíveis.

A inteligência artificial eleva a aposta. Segundo o Gartner, até 2026, 60% dos projetos de IA sem dados preparados devem ser abandonados. Modelos aprendem com o que recebem: dados fragmentados produzem respostas fragmentadas.

De 32,5 milhões de registros para 11,9 milhões de pessoas

A fragmentação nasce de forças presentes em quase toda organização grande: ausência de uma chave comum (o CPF nem sempre está lá), campos livres sem validação, formatos legados, integrações feitas por cópia e correções que ficam no relatório em vez de voltar à origem. O resultado era uma média de 2,7 registros para cada pessoa real, o que infla indicadores, esconde vínculos e faz cada consulta processar quase três vezes mais linhas do que o necessário.

A resposta combinou padronização, deduplicação e gestão de dados mestres. A base convergiu para 11,9 milhões de pessoas únicas, 63% menos registros, cada uma representada por um golden record: a versão única e confiável da entidade, que aponta para todos os registros de origem sem apagar nenhum deles, o que permite auditar e desfazer vínculos equivocados.

Um endereço sem coordenadas não existe no mapa

O mesmo raciocínio vale para endereços. No ponto de partida, 35 milhões de endereços não tinham latitude e longitude, e 85% deles também não tinham CEP, o que impedia o atalho da geocodificação pelo código postal. Tratar o endereço como dado mestre, padronizando antes de geocodificar e validando antes de gravar, permitiu georreferenciar os 35 milhões.

Seis blocos, não uma ferramenta

Uma limpeza pontual melhora a base por alguns meses; sem regras, responsáveis e monitoramento, a desordem volta. O white paper descreve um programa de seis blocos organizados em três camadas: corrigir o dado, consolidar a verdade e sustentar a confiança.

  • Padronização: um jeito só de escrever cada nome, data, documento e endereço, sem perder o valor original.
  • Deduplicação: regras determinísticas e comparação probabilística para decidir, em escala, quais registros descrevem a mesma entidade, com revisão humana nos casos ambíguos.
  • Gestão de dados mestres: o golden record, com regras explícitas sobre qual valor prevalece em cada atributo e de onde ele veio.
  • Regras de qualidade: dez dimensões, da acurácia à acessibilidade, consolidadas em um índice por domínio.
  • Monitoramento e observabilidade: atualidade, volume, esquema e distribuição acompanhados continuamente, com alertas antes que o problema chegue a um painel ou a um modelo.
  • Governança e metadados: catálogo, glossário, linhagem de ponta a ponta e donos nomeados para cada ativo crítico.

Onde a qualidade de dados vira inteligência fiscal

Na administração tributária, a fraude raramente está em um cadastro isolado: está nos vínculos entre sócios, endereços, contadores e notas fiscais. A análise de redes de relacionamento só funciona sobre entidades bem identificadas. Se o mesmo sócio aparece como três nós, o articulador do esquema se perde no ruído; se homônimos são unidos sem critério, um contribuinte regular passa a parecer parte de um esquema. Com entidades padronizadas, os mesmos vínculos passam a apontar para as entidades certas, e o padrão aparece.

Como começar: ondas, não big bang

Programas de dados fracassam quando tentam abraçar a organização inteira de uma vez. O caminho recomendado é concentrar o esforço inicial em dois ou três domínios prioritários (pessoas e endereços costumam ser os que mais alavancam análises), medir o progresso com indicadores claros e expandir em ondas. O documento propõe 15 indicadores, da taxa de duplicidade ao tempo de resolução de incidentes, e mostra um plano real de implantação de plataforma de metadados em 31 semanas.

O white paper completo, com os quadros, as regras de exemplo e o painel de métricas, está disponível para download gratuito.

Quer ver isso aplicado à sua operação?

Fale com quem opera dados e IA em missão crítica há 28 anos.