Glossário

Sob o GDPR, a reversibilidade decide pseudonimização vs anonimização

Taras Shynkarenko
Taras Shynkarenko
•Atualizado: •9 min de leitura
Sob o GDPR, a reversibilidade decide pseudonimização vs anonimizaçãoSob o GDPR, a reversibilidade decide pseudonimização vs anonimização

TL;DR, Resposta rápida

9 min de leitura

A pseudonimização substitui um identificador por um token que informações adicionais conseguem reverter, e o Article 4(5) do GDPR mantém o resultado dentro da definição de dados pessoais. A anonimização elimina a identificabilidade diante de todos os meios razoavelmente utilizáveis, e o Recital 26 então tira os dados do Regulamento. Aplicar hash a um endereço IP ou a um ID de usuário é pseudonimização, porque o espaço de entrada é pequeno o bastante para passar inteiro pela função hash de novo.

O que decide pseudonimização vs anonimização sob o GDPR?

O GDPR resolve pseudonimização vs anonimização com uma única pergunta, se alguém consegue reverter a substituição: dados pseudonimizados podem ser atribuídos de volta a uma pessoa com informações adicionais guardadas separadamente, então continuam sendo dados pessoais e toda obrigação do Regulamento continua valendo, enquanto dados anonimizados não podem ser atribuídos a uma pessoa por nenhum meio razoavelmente utilizável, então o Regulamento deixa de se aplicar a eles. As informações adicionais são o mecanismo: enquanto uma chave, uma tabela de correspondência, um salt (o valor aleatório somado antes do hash) ou um log de origem bruto sobreviver em algum lugar, os dados estão pseudonimizados. Antes de rotular um conjunto de dados como anônimo, encontre cada cópia do material que o reverteria e confirme que ela sumiu.

Como o Article 4(5) do GDPR define a pseudonimização?

O Article 4(5) do Regulamento (UE) 2016/679 define pseudonimização como "o tratamento de dados pessoais de forma que deixem de poder ser atribuídos a um titular de dados específico sem recorrer a informações suplementares, desde que essas informações suplementares sejam mantidas separadamente e sujeitas a medidas técnicas e organizativas para assegurar que os dados pessoais não possam ser atribuídos a uma pessoa singular identificada ou identificável".

Leia as condições dessa frase. A definição pressupõe que as informações adicionais continuam existindo, exige armazenamento separado para elas e não tira nada do alcance do Regulamento. O GDPR trata a pseudonimização como salvaguarda, não como saída: o Article 25(1) cita a técnica como exemplo das medidas que um controlador aplica para proteção de dados desde a concepção, e o Article 32(1)(a) lista "A pseudonimização e a cifragem dos dados pessoais" entre as medidas de segurança.

Que teste o Recital 26 fixa para a anonimização?

O Recital 26 fixa um teste de meios, não um teste de técnica, e esta frase resolve a questão: "Para determinar se uma pessoa singular é identificável, importa considerar todos os meios suscetíveis de ser razoavelmente utilizados, tais como a seleção, quer pelo responsável pelo tratamento quer por outra pessoa, para identificar direta ou indiretamente a pessoa singular."

A frase seguinte traz os fatores: "importa considerar todos os fatores objetivos, como os custos e o tempo necessário para a identificação, tendo em conta a tecnologia disponível à data do tratamento dos dados e a evolução tecnológica."

Depois o considerando traça a linha. "Os princípios da proteção de dados não deverão, pois, aplicar-se às informações anónimas, ou seja, às informações que não digam respeito a uma pessoa singular identificada ou identificável nem a dados pessoais tornados de tal modo anónimos que o seu titular não seja ou já não possa ser identificado." O Recital 26 decide sobre dados pseudonimizados na mesma frase de abertura, ao dizer que dados que "possam ser atribuídos a uma pessoa singular mediante a utilização de informações suplementares, deverão ser considerados informações sobre uma pessoa singular identificável". Custo, tempo e tecnologia mudam, então uma alegação de anonimização feita em 2019 precisa de um novo teste agora.

Racks de servidores com cabos de rede emaranhados, representando os dados brutos de identificadores sobre os quais o hash atua.

Por que aplicar hash a um endereço IP ou a um ID de usuário conta como pseudonimização?

Aplicar hash a um identificador tirado de um conjunto pequeno e conhecido é pseudonimização, porque um atacante consegue aplicar hash a toda entrada possível e casar os resultados com a sua tabela. O trabalho tem o tamanho do espaço de entrada:

candidate inputs to test = 2 ^ (bits in the identifier)

Um endereço IPv4 tem 32 bits de largura, então todo o espaço de candidatos é 2^32 = 4.294.967.296 endereços. Recuperar cada endereço original de uma tabela de endereços IPv4 com hash SHA-256 significa aplicar hash a 4.294.967.296 valores uma vez e comparar. IDs de usuário sequenciais são piores: uma tabela que numera usuários de 1 a 5.000.000 tem 5.000.000 candidatos, 859 vezes menos que o espaço IPv4.

O Grupo de Trabalho do Artigo 29 escreveu isso por extenso no Parecer 05/2014 sobre técnicas de anonimização (WP216), adotado em 10 de abril de 2014: "se um conjunto de dados tiver sido objeto da utilização de pseudónimos através da aplicação da função hash ao número de identificação nacional, o valor pode ser derivado através da simples utilização da função hash em todos os valores possíveis de entrada e da comparação do resultado com os valores constantes no conjunto de dados". O parecer expõe a conclusão com todas as letras: "a utilização de pseudónimos não é um método de anonimização de dados pessoais. Apenas dificulta a possibilidade de correspondência de um conjunto de dados à identidade original de um titular de dados e é, por conseguinte, uma medida de segurança útil". O WP216 arquiva o hash entre as técnicas de pseudonimização e nomeia como erro comum a crença de que um conjunto de dados pseudonimizado está anonimizado.

O salt muda a aritmética, não a categoria. O WP216 coloca assim: uma função hash com salt "é passível de reduzir a probabilidade da determinação do valor de entrada mas, ainda assim, continua a ser possível de efetuar, mediante os meios razoáveis, o cálculo do valor original do atributo escondido por detrás do resultado de uma função hash com uma variável criptográfica". Pergunte ao seu fornecedor de analytics qual movimento ele faz e quem guarda o salt.

Como um identificador com hash é revertido
1
Fixar a função de hash. O atacante descobre ou deduz qual função gerou a tabela, por exemplo SHA-256.
2
Aplicar hash a cada valor candidato. 2^32 para um endereço IPv4, ou 5.000.000 para IDs de usuário sequenciais.
3
Comparar os resultados com a tabela. Cada correspondência revela o identificador original por trás do hash.
O WP216 descreve exatamente esse ataque de repetição para números de identificação com hash e classifica o hashing como pseudonimização, não anonimização.

O que muda quando os dados são pseudonimizados em vez de anonimizados?

Toda obrigação que gruda em dados pessoais gruda em dados pseudonimizados e desgruda de dados anônimos.

PerguntaDados pseudonimizadosDados anonimizados
Reversíveis com informações adicionaisSimNão
Contam como dados pessoaisSimNão
Precisam de base legal do Article 6SimNão
Direitos de acesso e eliminação do Chapter IIIValemNão valem
Notificação de violação do Article 33ValeNão vale
Técnicas que o WP216 põe aquiHash, hash com salt, hash com chave, cifragem com chave secreta, tokenizaçãoAgregação, generalização, adição de ruído

O WP216 julga cada técnica candidata contra três riscos: isolar os registros de uma pessoa, ligar dois registros à mesma pessoa e inferir o valor de um atributo a partir de outros atributos. Uma técnica que deixa qualquer um dos três em aberto não produziu dados anônimos.

Um advogado revisando um documento jurídico impresso, refletindo a avaliação caso a caso que os tribunais aplicam a dados pseudonimizados.

Dados pseudonimizados podem deixar de ser dados pessoais?

Podem, para um detentor específico, e a Court of Justice of the European Union disse isso em EDPS v SRB, Case C-413/23 P, decidido em 4 de setembro de 2025. No parágrafo 86 o Tribunal declarou que "não se deve considerar que os dados pseudonimizados constituem, em todo o caso e para qualquer pessoa, dados pessoais para efeitos da aplicação do Regulamento 2018/1725", o regulamento que cobre as instituições da UE, cuja definição de dados pessoais o Tribunal chamou no parágrafo 52 de "em substância, idêntica" à do Article 4(1) do GDPR. A avaliação corre por detentor: um destinatário sem rota até as informações adicionais fica em posição diferente do controlador que as gerou. O teste que separa um controlador de dados de um operador de dados decide de quem é esse julgamento. Não é licença para rotular seus próprios logs com hash como anônimos enquanto a chave fica no seu próprio cofre de chaves.

Flowsery
Flowsery

Comece seu teste grátis de 14 dias

Painel em tempo real

Rastreamento de metas

Rastreamento sem cookies

O que uma equipe de analytics deve fazer com isso?

Pare de coletar o identificador em vez de aplicar hash nele, porque um identificador com hash mantém presa ao registro cada obrigação do GDPR. A Flowsery é construída assim: sem cookies, hospedada na UE e GDPR by design, exposta na página de analytics que respeita a privacidade e nas notas do GDPR da Flowsery. Páginas relacionadas cobrem se um endereço IP é um dado pessoal, o mascaramento de campos sensíveis no session replay, analytics que roda sem cookies e analytics em conformidade com o GDPR sem banner de consentimento.

Esta página descreve o que dizem os instrumentos, pareceres e decisões citados, e não é aconselhamento jurídico.

Perguntas frequentes

Dados pseudonimizados ainda são dados pessoais sob o GDPR?

Sim. O Article 4(5) define pseudonimização como um tratamento que corta a atribuição a um titular de dados "sem recorrer a informações suplementares", o que significa que com elas a atribuição é possível. O Recital 26 afirma que dados que possam ser atribuídos a uma pessoa mediante a utilização de informações suplementares devem ser considerados informações sobre uma pessoa singular identificável.

O GDPR se aplica a dados anonimizados?

Não. O Recital 26 afirma que os princípios da proteção de dados não deverão aplicar-se às informações anónimas, "ou seja, às informações que não digam respeito a uma pessoa singular identificada ou identificável nem a dados pessoais tornados de tal modo anónimos que o seu titular não seja ou já não possa ser identificado". O mesmo considerando acrescenta que o Regulamento não diz respeito ao tratamento dessas informações, inclusive para fins estatísticos ou de investigação.

Aplicar hash a um endereço IP basta para anonimizá-lo?

Não. Um endereço IPv4 tem 2^32 = 4.294.967.296 valores possíveis, então quem tem a tabela com hash consegue aplicar hash em todos e casar a saída. O WP216 descreve exatamente esse ataque de repetição para números de identificação com hash e classifica o hash como técnica de pseudonimização. O salt levanta o trabalho por conjunto de dados sem mudar a classificação.

O que é o teste dos "meios suscetíveis de ser razoavelmente utilizados"?

É o teste de identificabilidade do Recital 26: "importa considerar todos os meios suscetíveis de ser razoavelmente utilizados, tais como a seleção, quer pelo responsável pelo tratamento quer por outra pessoa, para identificar direta ou indiretamente a pessoa singular". O considerando nomeia depois os fatores objetivos a pesar: os custos da identificação, o tempo necessário e a tecnologia disponível. O teste cobre meios ao alcance de qualquer um, não só de você.

A pseudonimização reduz em algo as obrigações do GDPR?

Ela muda como um controlador cumpre as obrigações sem removê-las. O Recital 28 diz que aplicar a pseudonimização "pode reduzir os riscos para os titulares de dados em questão e ajudar os responsáveis pelo tratamento e os seus subcontratantes a cumprir as suas obrigações de proteção de dados", e o Article 32(1)(a) conta a técnica como medida de segurança. Nenhuma das duas disposições tira uma única obrigação do registro.

Quem decide se um conjunto de dados conta como anonimizado?

O controlador faz a avaliação e precisa conseguir defendê-la, porque o Recital 26 monta o teste em torno de custos, tempo e tecnologia disponível em vez de uma lista de técnicas aprovadas. O WP216 fornece as três perguntas a responder: isolamento, ligabilidade, inferência. Um sim a qualquer uma delas significa que o conjunto de dados está pseudonimizado, não anonimizado.

A criptografia conta como pseudonimização ou como anonimização?

A criptografia é pseudonimização enquanto alguém mantiver a chave, porque o texto cifrado pode ser revertido com informação adicional da mesma forma que uma tabela com hash. O WP216 classifica a criptografia de chave secreta junto com o hashing e a tokenização como técnica de pseudonimização, não de anonimização. O Article 32(1)(a) agrupa pseudonimização e criptografia como medidas de segurança para dados pessoais, o que só faz sentido se os dados criptografados continuarem a contar como dados pessoais.

Que técnicas o WP216 classifica como anonimização?

O WP216 coloca agregação, generalização e adição de ruído na coluna da anonimização, separadas do hashing, do hash com sal, do hash com chave, da criptografia de chave secreta e da tokenização, que trata como pseudonimização. Uma técnica só merece o rótulo de anonimização quando fecha os três riscos que o WP216 testa: singling out dos registros de uma pessoa, ligação de dois registros à mesma pessoa e inferência de um atributo a partir de outros atributos. Se qualquer um dos três permanecer aberto, o conjunto de dados continua pseudonimizado.

Uma empresa que recebe dados com hash de outra empresa pode tratá-los como anônimos?

Só se essa empresa não tiver nenhuma via de acesso à informação adicional necessária para revertê-los. O Tribunal de Justiça da União Europeia decidiu em EDPS v SRB que os dados pseudonimizados não são dados pessoais "in all cases and for every person", então a avaliação corre por destinatário, não por conjunto de dados. Um destinatário sem acesso à chave ou à tabela de correspondência está numa posição diferente da do controlador que gerou os dados e ainda os mantém.

Por que uma avaliação de anonimização não pode ser permanente?

O Recital 26 liga a identificabilidade a custos, tempo e tecnologia disponível, três fatores que mudam conforme o poder de computação cresce e as técnicas melhoram. Um conjunto de dados cuja reidentificação levava tempo demais em 2019 pode se tornar identificável assim que hardware mais rápido ou novos métodos reduzam esse custo. O status de anonimização precisa ser reavaliado contra a tecnologia atual em vez de ser considerado válido para sempre.

Este artigo foi útil?

Diga-nos o que pensa!

Veja-nos mais no Google

Um clique marca a Flowsery como fonte preferida e nossos artigos passam a aparecer mais acima nas suas Principais notícias, no modo IA e nas visões gerais com IA.

Antes de ir...

Flowsery

Flowsery

Analytics orientado para receitas para o seu site

Rastreie cada visitante, fonte e conversão em tempo real. Simples, poderoso e sem cookies.

Painel em tempo real

Rastreamento de metas

Rastreamento sem cookies

Termos relacionados do glossário

Sob o GDPR e a CCPA, um endereço IP é um dado pessoal?Sob o GDPR e a CCPA, um endereço IP é um dado pessoal?
Glossário

Sob o GDPR e a CCPA, um endereço IP é um dado pessoal?

Sob o GDPR, um endereço IP é um dado pessoal sempre que o operador do site tem meios legais para identificar o visitante, decidiu o CJEU em Breyer.

•8 min de leitura
Entenda o CPRA, a lei de direitos de privacidade da CalifórniaEntenda o CPRA, a lei de direitos de privacidade da Califórnia
Glossário

Entenda o CPRA, a lei de direitos de privacidade da Califórnia

O CPRA alterou de fato o CCPA em 2023, adicionando regras sobre informações pessoais sensíveis, o direito de corrigir dados e uma agência dedicada, a CPPA.

•8 min de leitura
O teste que resolve controlador vs processador de dadosO teste que resolve controlador vs processador de dados
Glossário

O teste que resolve controlador vs processador de dados

O teste do GDPR para controlador vs processador de dados é quem determina as finalidades e os meios. O que cada papel assina, deve e faz diante de uma violação.

•9 min de leitura
O Google lista sete causas distintas de not set no GA4O Google lista sete causas distintas de not set no GA4
Glossário

O Google lista sete causas distintas de not set no GA4

O Google dá a not set no GA4 uma causa diferente por dimensão, de um session_start ausente a um content_group vazio. Veja cada causa e a correção.

•9 min de leitura
O que o server-side tracking corrige e o que ele deixa intocadoO que o server-side tracking corrige e o que ele deixa intocado
Glossário

O que o server-side tracking corrige e o que ele deixa intocado

O que o server-side tracking leva para o seu servidor, quais limites de cookies do Safari ele evita, como deduplicar eventos e por que o consentimento continua.

•9 min de leitura
O que estes números revelam sobre a taxa de rejeição média por setorO que estes números revelam sobre a taxa de rejeição média por setor
Glossário

O que estes números revelam sobre a taxa de rejeição média por setor

Nove setores rastreados mostram uma taxa de rejeição média por setor documentada, entre 35.76% e 48.38%, segundo dados da Databox de setembro de 2024.

•7 min de leitura

Artigos relacionados