21 DE NOV DE 2017
A maneira segura de construir Cidades Inteligentes x Dados abertos
Qualquer cidade com iniciativas de dados enfrenta as mesmas questões: quanto informação o governo deve liberar e de que forma? A abordagem proativa, mas cautelosa, de Seattle, poderia fornecer a resposta.
Estudo de Caso Amerciano
Qualquer cidade com iniciativas de dados enfrenta as mesmas questões: quanto informação o governo deve liberar e de que forma? A abordagem proativa, mas cautelosa, de Seattle, poderia fornecer a resposta.
Não precisamos cavar fundo para descobrir o que pode dar errado com iniciativas de dados abertos. Basta olhar para 2014, quando a Comissão de Taxi e Limousine da Cidade de Nova York lançou centenas de milhões de registros em viagens de táxi na cidade, com dados anônimos para proteger detalhes identificáveis, pelo menos em teoria. Na realidade, os dados foram gravados em um formato que permitiu que um engenheiro de software re-identifique os números de licença dos táxis e drivers . Um jornalista de Gawker ligou isso a celebridades que levaram passeios de táxi nos meses da cidade após a liberação inicial, especulando sobre as rotas que haviam tomado.
Certamente, não são os dados mais sensíveis para serem vazados ou pirateados, mas é uma ilustração importante dos riscos que as cidades enfrentam na divulgação de dados de suas diversas agências constituintes. As implicações nem sempre são evidentes até muito tempo depois de a informação estar fora do domínio público.
Nos últimos anos, à medida que a área do metrô de Seattle se transformou em um centro tecnológico próspero , a cidade tem sido pioneira em uma abordagem progressiva e cuidadosamente considerada para a divulgação de dados públicos. Lentamente, mas com certeza, as autoridades da cidade criam o que esperam poder servir de modelo para "cidades inteligentes" em todo o mundo. Uma parte fundamental deste plano veio em 2016, quando a cidade adotou uma resolução de que todos os dados cívicos seriam "abertos de preferência", e não "abertos por padrão". Como David Doyle, Gerente do Programa de Dados Abertos da Seattle Information Technology, explica: Esta camada extra de precaução visa tornar a cidade mais deliberada sobre suas práticas de dados desde o início.
"As políticas foram desenvolvidas pela primeira vez com" abrir por padrão "em mente, mas isso não é realmente viável quando você considera fatores como a privacidade", diz ele. "Seattle tomou uma abordagem mais matizada de ser aberta de preferência: isso significa que podemos estar abertos [com dados] uma vez que atenuamos os riscos de privacidade, a liberação de informações de identificação pessoal e outros tipos de danos".
Essencialmente, uma política aberta por padrão significaria "publicar primeiro, fazer perguntas depois": os conjuntos de dados coletados por todas as agências governamentais da cidade, departamento de polícia, autoridade de habitação, departamento de transporte, etc., seriam divulgados on-line a menos que houvesse um claro motivo para não. Aberto de preferência fala em uma abordagem mais medida: os conjuntos de dados civis são avaliados de forma proativa com vista a liberá-los sempre que possível, mas somente depois de terem sido revisados por autoridades da cidade.
Em um exemplo, Doyle explica que os dados do Serviço de Envelhecimento e de Deficiência da cidade foram lançados para apoiar um hackathon focado na resolução de desafios de acessibilidade. Uma vez que os dados sobre deficiência, renda, etnia e localização exata eram extremamente sensíveis, as equipes de vários departamentos trabalharam juntas para agrupá-lo em segmentos de vizinhança e faixas etárias, reduzindo a identificação enquanto ainda fornecem um recurso útil para os participantes no evento.
Como parte da resolução de 2016 sobre dados abertos, Seattle também se comprometeu com uma avaliação de risco anual e divulgada publicamente em seu programa de dados aberto. Este ano, o Fórum de Futuro do Privado (FPF), sem fins lucrativos, com base na privacidade, foi encomendado para realizar a tarefa, que culminou com o lançamento de um rascunho de relatório em agosto que está atualmente aberto ao público.
O relatório visa não apenas analisar o progresso da cidade com a divulgação de dados, mas também desenvolver uma estrutura para avaliar os riscos das iniciativas abertas de dados em geral. A idéia é estabelecer critérios claros para julgar os benefícios e desvantagens da publicação de um determinado conjunto de dados, levando a uma pontuação que pode informar uma decisão sobre como proceder.
Ainda assim, avaliar corretamente os riscos de uma violação de privacidade é uma tarefa difícil: alguns dados pessoais são fáceis de classificar como muito sensíveis para a liberação pública, os números da Segurança Social são um exemplo, ou pelo menos deve ser. Mas outros dados se enquadram em uma área cinzenta. Fazer uma informação médica pública é importante para a pesquisa epidemiológica, por exemplo, mas os detalhes sobre condições médicas específicas não devem ser rastreados de volta a pacientes individuais.
A fim de colher os benefícios potenciais da categoria sensível, mas não secreta, os dados geralmente são anônimos antes de serem liberados, mas garantir o anonimato é muito mais fácil do que fazer. Em um estudo amplamente citado de 2000, a professora de Harvard, Latanya Sweeney (então em Carnegie Mellon) descobriu que 87% dos americanos poderiam ser identificados de forma exclusiva em um conjunto de dados apenas por gênero, data de nascimento e código postal . Isso pode ser referenciado com os registros do eleitor para identificar cada indivíduo por nome.
Este é o problema central que as cidades como Seattle enfrentam ao tentar liberar dados anônimos: os detalhes que não são identificados quando isolados podem facilmente se tornar únicos em combinação. Um diagrama do trabalho de pesquisa de Latanya Sweeney mostra como os detalhes compartilhados entre conjuntos de dados podem levar à anulação de anônimos.
Dada a abundante necessidade de controles de privacidade na era digital, pode ser uma surpresa saber que as definições legais de informações de identificação pessoal não foram atualizadas há décadas. Nos Estados Unidos, "Identificação Pessoal de Informações" é um termo legal com significado específico na Lei de Privacidade de 1974, mas a lei estabelece a linha entre a identificação e a informação não identificadora de uma maneira que ignora as realidades da segurança da informação moderna.
"O problema é, como um assunto técnico real, é uma distinção sem sentido", diz Joseph Jerome, um advogado de políticas no Centro de Democracia e Tecnologia. "Quando você olha a política de dados aberta, há uma questão sobre quantos identificadores indiretos diferentes podem ser colocados em dados antes de ter algo que identifica completamente alguém. Por isso, em alguns aspectos, trata-se de um debate de política legal, mas também é um debate técnico, e a resposta não é clara ".
O debate é complicado pela necessidade de divulgar informações que serão úteis para análise, ao mesmo tempo que protegem a privacidade dos usuários, dois fatores que geralmente estão em oposição direta. Tecnicamente, os dados estão, pelo menos, identificando se cada indivíduo do grupo possui exatamente o mesmo resultado para cada variável, mas, então, os dados não têm sentido. Por definição, os dados úteis devem ser identificados em algum grau, e um julgamento deve ser feito sobre onde traçar a linha entre os dois.
Como orientação, o especialista em desidentificação estatística Khaled El Emam sugeriu que não mais de seis a oito identificadores indiretos devem ser incluídos em qualquer conjunto de dados, o que também deve ser modificado de modo a garantir um certo limiar de "anonimato-k :" A significado do termo que, mesmo combinando os identificadores indiretos, um número mínimo de indivíduos sempre compartilhará os mesmos valores, de modo que nenhum registro seja completamente exclusivo.
Todas essas restrições técnicas e legais podem tornar difícil para as cidades saber quando os dados foram processados suficientemente bem para serem liberados com segurança. Pode ser ainda mais difícil para os cidadãos saber se eles podem ser identificados a partir de um determinado conjunto de dados. Combinar esse problema é o fato de que os governos municipais, ao contrário das corporações privadas, também podem ser obrigados a divulgar informações sob leis de registros públicos.
Foi exatamente essa situação que levou a Comissão de Taxi e Limousine de Nova York a liberar dados insuficientemente anônimos sobre viagens de táxi. Se não fosse um pedido de um ativista da liberdade de informação , não teria sido divulgado publicamente em primeiro lugar.
Créditos:
Dan Bevarly é diretor executivo da National Freedom of Information Coalition (NFOIC), uma aliança de grupos da sociedade civil que defendem o governo aberto. Apesar de sua organização pressionar por uma maior transparência, ele também está consciente da necessidade de cautela e sugere que orçamentar mais tempo e recursos para pedidos de registro público poderia ajudar a atingir esse equilíbrio sem limitar o acesso à informação.
"Nós vemos uma área que exige mais especialização, e esse é o administrador de registros públicos", diz Bevarly. "Nós pensamos que um treinamento muito mais formal deve ser fornecido, principalmente por causa da mudança da legislação e do crescente uso da tecnologia para gerenciar informações e se comunicar".
Ele também acredita que as instituições públicas podem ser mais pró-ativas na divulgação de informações adequadamente sanitizadas antes do tempo, reduzindo o risco de divulgação incorretamente tratada em resposta a uma solicitação de registros públicos. Mas enquanto Bevarly e outros especialistas desempenham um papel fundamental na definição do debate sobre os dados abertos, também é crucial solicitar a participação do maior partido envolvido: o público em geral.
Fonte: LinkedIn