Raio-X de PDFdetector de prompt injection
Documentos podem trazer instruções invisíveis, plantadas para manipular a IA que os lê: em fonte minúscula, fora da margem ou com caracteres que não aparecem na tela. Um modelo de linguagem não distingue sozinho o que é conteúdo para analisar do que é comando para executar, então ele obedece ao texto oculto junto com o resto. Esta ferramenta abre o PDF e mostra esses sinais, antes que a IA os leia.
O arquivo é lido no seu navegador: o documento não sai do seu computador e não usamos IA na análise. Registramos apenas um sinal anônimo de que a ferramenta foi usada, sem o nome do arquivo e sem nada do conteúdo. Detalhes na Política de privacidade.
Analise um PDF
Prompt injection, jailbreak e prompt leaking
Três nomes que costumam aparecer juntos e significam coisas diferentes:
- Prompt injection: alguém esconde um comando dentro de um documento que você recebe, para que a IA encarregada de lê-lo obedeça sem que você perceba. É isto que esta ferramenta procura.
- Jailbreak: é o próprio usuário que contorna as regras da IA que está usando, com um prompt elaborado. Parte de quem digita, não do documento; esta ferramenta não procura isso.
- Prompt leaking: fazer a IA revelar as instruções internas que a governam, ou dados que ela não deveria expor. Costuma ser o objetivo de uma injeção, não uma técnica de ocultação.
A ferramenta atua sobre a primeira. Ela não julga a intenção do que está escondido: mostra que existe texto que você não vê e que uma IA leria.
Metodologia e limites
Publicamos o que a ferramenta faz e o que ela não faz. A v1.1 verifica:
- Fonte minúscula: texto em tamanho quase invisível (menor que 2pt), medindo o tamanho real da fonte mesmo com rotação, para que o carimbo vertical do PJe não vire falso positivo.
- Texto invisível ou branco: texto desenhado em modo de renderização invisível ou pintado da cor do papel: o leitor não vê, mas uma IA lê. Instrução aí dentro é grave. (novo na v1.1)
- Texto fora da área visível: texto escondido na margem, entre a área de recorte (CropBox) e a borda do papel; recuperado reabrindo o PDF sem o recorte. (novo na v1.1)
- Caracteres invisíveis: caracteres de largura zero e controles bidirecionais embutidos no texto.
- Linguagem de instrução a IA: frases típicas de prompt injection, em português e inglês, classificadas como graves só quando estão em texto oculto.
- Metadados, anotações, JavaScript e anexos: instrução escondida em metadados/anotações e a presença — não a execução nem o conteúdo — de JavaScript e de arquivos embutidos no PDF.
- PDFs escaneados (imagem): sem OCR, não há texto para inspecionar. Uma camada de reconhecimento (OCR) invisível é sinalizada, mas a ferramenta não avalia o que a imagem mostra.
- Conteúdo de anexos embutidos e formulários XFA: a presença de arquivo embutido é sinalizada, mas o que está dentro dele não é aberto — analise cada anexo separadamente. Formulários XFA (XML) também ficam fora da inspeção.
Publicamos esta lista porque confiança se constrói sabendo exatamente no que se está confiando. Cada versão nova existe para encurtá-la.
Precisa preparar um PDF de texto digital para uso em fluxos de IA? Veja também o Conversor PDF → Markdown.