|

A origem do CAPTCHA: de filtro antispam a treino de IA

Todo mundo já perdeu uns segundos identificando semáforos ou digitando letras tortas para provar que não é um robô. Poucos sabem que esse teste tem uma origem disputada, um nome que só foi cunhado três anos depois de existir na prática, e um destino final bem diferente do que combater spam: ele virou peça de treino para inteligência artificial.

Uma disputa de paternidade

Em 1997, a AltaVista — um dos maiores buscadores da época — enfrentava um problema: sistemas automatizados inundavam seu índice com URLs de spam. Andrei Broder, então cientista-chefe da empresa, criou um filtro que gerava imagens de texto distorcido, fáceis para humanos lerem e difíceis para os programas de reconhecimento óptico (OCR) da época. Em pouco mais de um ano, o filtro derrubou o volume de URLs maliciosas em 95%.

Em 2000, o Yahoo! enfrentava um problema parecido em suas salas de bate-papo, tomadas por bots publicitários, e recorreu a uma equipe da Carnegie Mellon University. Foi só em 2003 que Luis von Ahn, Manuel Blum, Nicholas Hopper (Carnegie Mellon) e John Langford (IBM) formalizaram o método em artigo acadêmico e batizaram a técnica de CAPTCHA — sigla para “Completely Automated Public Turing test to tell Computers and Humans Apart”. Até hoje há quem credite a criação à AltaVista e quem credite à Carnegie Mellon; a diferença é que só a segunda deu nome e formalização científica à ideia.

De teste anti-spam a fábrica de dados

A virada mais interessante veio em 2007, com o reCAPTCHA. Em vez de gerar palavras aleatórias, o sistema criado por von Ahn mostrava trechos de texto que os scanners de livros e jornais antigos não conseguiam decifrar. Cada vez que alguém resolvia o teste para entrar num site, também ajudava a digitalizar um pedaço de acervo real. Em 2009 o Google comprou a empresa e direcionou essa mão de obra involuntária para o Google Books e para o arquivo do New York Times, que teve mais de 13 milhões de páginas — de 1851 até o presente — digitalizadas com a ajuda de milhões de usuários resolvendo CAPTCHAs, num ritmo que chegou a 100 milhões de palavras por dia.

O próximo passo repetiu a fórmula com outro tipo de dado: a partir de 2012, o Google passou a usar o reCAPTCHA para decodificar números de endereços capturados pelo Street View e, mais tarde, para rotular semáforos, faixas de pedestre e carros nas imagens que hoje treinam sistemas de visão computacional e direção autônoma.

Por que isso importa hoje

O CAPTCHA clássico está em decadência técnica: redes neurais de OCR resolvem texto distorcido com taxa de acerto próxima da humana, o que forçou a indústria a migrar para verificação invisível baseada em comportamento — reCAPTCHA v3, hCaptcha e o Turnstile da Cloudflare avaliam padrões de mouse, histórico e sinais de rede em vez de pedir para o usuário provar nada. A ironia é que o teste criado para distinguir humano de máquina hoje treina justamente as máquinas que um dia vão passar nele sem esforço.

Gostou? Compartilhe.

Posts Similares

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *