Extrair texto de imagem
Solte o print ou a foto e receba o texto para copiar. Sem cadastro, e a imagem não sai do seu computador.
Na primeira vez o leitor é baixado (uns 10 MB). Depois disso ele fica guardado e a leitura começa na hora.
- Arquivo
- Tamanho
- Texto
- Confiança
A leitura saiu com confiança baixa. Confira o texto antes de usar, principalmente números.
Não encontrei texto nessa imagem. Se ela tem texto, veja as dicas logo abaixo: foto de frente, com boa luz e letra grande fazem quase toda a diferença.
Pronto, a imagem e o texto saíram da memória do navegador. Não havia nada para apagar em servidor, porque nada foi enviado.
Por que este leitor não pede upload
Quase todo site de OCR funciona assim: você envia a imagem, o servidor deles lê e devolve o texto. Funciona, e tem um custo que quase nunca aparece escrito.
A imagem que você quer transcrever costuma ser justamente a que não deveria sair da sua máquina: o print do contracheque, a foto do documento, a nota fiscal do cliente, a tela de um sistema interno. Em muita empresa isso esbarra na política de segurança, e com razão.
Aqui a conta é invertida. Em vez de a sua imagem ir até o programa, o programa vem até você: na primeira vez, o navegador baixa o leitor e o dicionário de português, e daí em diante tudo acontece dentro da aba. Você pode conferir desligando a internet depois da primeira leitura.
É a mesma ideia do nosso abridor de arquivos .msg e .eml, que também lê tudo dentro do navegador, e da matriz de Eisenhower online, em que a sua lista de tarefas nunca sai daí.
Como funciona por baixo
O motor é o Tesseract, um programa livre de reconhecimento de texto que existe desde os anos 80 e hoje é mantido pela comunidade. Ele foi compilado para WebAssembly, que é o formato que permite rodar programas assim dentro do navegador, na velocidade de um programa instalado.
Não há consulta a serviço nenhum e não há inteligência artificial generativa envolvida: o Tesseract reconhece as letras com uma rede neural treinada para isso e transcreve o que está escrito, sem interpretar, resumir ou completar o que faltou.
O que a ferramenta faz com a imagem antes de ler
- Confere o formato pelos bytes do início, não pela extensão. Arquivo renomeado à mão não passa;
- Converte para tons de cinza, porque texto colorido sobre fundo colorido confunde o limiar que o motor usa para separar letra de fundo;
- Amplia imagens pequenas. O motor foi treinado em digitalização de 300 pontos por polegada, e print de tela costuma ter 96: dobrar o tamanho resolve boa parte dos erros de letra pequena.
Onde o OCR acerta e onde ele erra
Vale saber antes de confiar no resultado:
- Acerta bem: print de tela, documento escaneado, foto de frente com boa luz e texto impresso;
- Erra às vezes: texto muito pequeno, coluna dupla, tabela, fundo colorido;
- Erra muito: foto torta, com sombra ou reflexo, e foto de tela de computador tirada com celular;
- Não funciona: letra manuscrita.
Se o texto que você está extraindo é um pedido de trabalho, o passo seguinte costuma ser virar tarefa. O artigo sobre como transformar e-mail em tarefa sem esquecer pedidos descreve o método, e o guia de como organizar as tarefas do trabalho mostra o processo inteiro.
Por isso a ferramenta mostra a confiança média de cada leitura. É a nota que o próprio motor dá para o trabalho dele, e serve de alerta: OCR erra em silêncio, e sem esse número um texto com palavra trocada parece tão certo quanto um texto correto. Confira sempre os números, que são onde o erro dói mais.
Perguntas frequentes
A imagem é enviada para algum servidor?
Não. A leitura acontece dentro do seu navegador. O que viaja pela internet é o contrário: o programa que lê o texto vem para a sua máquina na primeira vez que você usa, e a imagem fica onde sempre esteve.
Dá para conferir sozinho: use uma vez, recarregue a página, desligue a internet e extraia o texto de outra imagem. Se funcionar sem rede, é porque nada estava sendo enviado.
Quais formatos são aceitos?
JPG, PNG, WEBP e BMP. O formato é reconhecido pelos primeiros bytes do arquivo, não pela extensão: renomear um PDF para .png não engana a ferramenta, e você recebe um aviso em vez de um resultado errado.
PDF não entra por enquanto. Se o seu documento é um PDF, uma saída rápida é tirar um print da página e soltar o print aqui.
Por que demora na primeira vez?
Porque o leitor de texto precisa vir para o seu navegador: são cerca de 10 MB somando o motor e o dicionário de português. Esse download acontece uma vez só, e só quando você escolhe uma imagem. Quem abre a página para ler não baixa nada disso.
Depois disso o motor fica no cache do navegador e o idioma fica guardado, então a segunda imagem começa a ser lida na hora.
Em que tipo de imagem funciona bem?
Funciona bem em print de tela, documento escaneado direito e foto tirada de frente, com boa luz e texto impresso. Nesses casos o acerto costuma passar de 90%.
Funciona mal em foto torta, com sombra ou reflexo, em texto muito pequeno e em tabela de várias colunas. E não funciona em letra manuscrita: o leitor foi treinado em texto impresso.
O que é aquela porcentagem de confiança?
É a nota que o próprio leitor dá para o que ele acabou de ler, de 0 a 100. Acima de 85% o texto costuma sair limpo. Entre 70% e 85% vale uma conferida. Abaixo de 70% é bem provável que tenha palavra trocada.
Esse número existe porque OCR erra em silêncio: sem ele, um texto com erro parece tão certo quanto um texto correto.
Como melhorar o resultado?
Fotografe de frente, com a folha inteira no quadro e boa luz, sem sombra da própria mão. Se for print de tela, dê zoom antes de printar: letra maior na imagem significa menos erro.
Corte o que não interessa antes de soltar aqui. Quanto menos ruído em volta do texto, melhor. A ferramenta já converte para cinza e amplia imagens pequenas automaticamente.
Isso usa inteligência artificial?
Usa um motor de reconhecimento chamado Tesseract, que é um programa livre com mais de trinta anos de história e que hoje usa uma rede neural treinada para reconhecer letras. Não é inteligência artificial generativa e não existe consulta a nenhum serviço: o programa inteiro roda dentro da sua aba.
A diferença aparece no resultado: ele transcreve o que está escrito, sem interpretar, resumir ou completar o que faltou.
E quando o print é um pedido de trabalho?
Copiar o texto resolve hoje. Se o que chegou na imagem é mais uma tarefa para a sua lista, o Pra Ontem transforma a imagem em demanda, com o que fazer, o prazo, a prioridade e quem pediu.
Conhecer o Pra Ontem