Seu Prompt Não Está Funcionando: Depure Com Três Modelos
Uma rotina de quinze minutos que diz se você deve reescrever o prompt ou trocar de modelo.
Resumo
Rode o prompt que falhou em dois ou três modelos ao mesmo tempo. Se todos erram do mesmo jeito, o problema é o prompt, e costuma ser falta de contexto, falta de formato de saída, duas tarefas em um pedido só ou ausência de critérios de sucesso. Se um modelo acerta, mantenha o prompt e troque o modelo.
O problema é o prompt ou o modelo?
Mande o mesmo prompt para dois ou três modelos ao mesmo tempo e leia as falhas lado a lado. Se todos erram do mesmo jeito, o problema é o prompt. Se um acerta e os outros não, o prompt está bom e o que você tem é um problema de escolha de modelo.
Esse teste único elimina quase todo o chute. No aiDex, o Comparar dispara um único prompt para vários modelos em paralelo e mostra as respostas lado a lado, então o padrão aparece em uma tela só, em vez de três abas do navegador. O passo a passo completo está em como comparar modelos de IA.
| O que você vê | O que significa | O que mudar |
|---|---|---|
| Todos erram da mesma forma | Problema de prompt | Adicione contexto, formato, critérios |
| Cada um responde uma coisa | Prompt ambíguo | Restrinja escopo e formato |
| Um acerta e os outros não | Escolha de modelo | Mantenha o prompt, troque o modelo |
| Respostas certas, mas inaproveitáveis | Problema de formato | Peça tamanho e estrutura |
O que costuma quebrar um prompt?
Quatro coisas, mais ou menos na ordem em que aparecem.
Falta de contexto. O modelo não enxerga a sua empresa, o seu cliente nem a decisão da semana passada. A orientação da Anthropic é tratar o modelo como um colega talentoso no primeiro dia de trabalho: ele precisa do pano de fundo que você considera óbvio, escrito de forma explícita (documentação de prompt engineering da Anthropic).
Nenhum formato de saída. "Escreva sobre os nossos preços" não tem formato. "Escreva 120 palavras, em três tópicos, para um diretor financeiro que nunca ouviu falar da gente" tem. O formato é o que transforma uma resposta correta em uma resposta usável.
Duas tarefas em um pedido só. Análise, reescrita e recomendação no mesmo prompt normalmente rendem uma versão fraca das três. Separe em turnos diferentes.
Nenhum critério de sucesso. Se você não disse como é uma boa resposta, não consegue apontar o erro para o modelo nem comparar duas reescritas entre si.
O guia da OpenAI faz um ponto parecido sobre onde colocar cada coisa: papel e tom vão na mensagem de sistema, e a tarefa, as restrições e os exemplos vão na mensagem do usuário (guia de prompt engineering da OpenAI).
Como depurar um prompt passo a passo?
Cinco passos, uns quinze minutos.
1. Reproduza no Solo. Rode o prompt que falhou uma vez, sem mudar nada, e anote o defeito específico: escopo errado, fato inventado, tom errado, longo demais. "Ficou ruim" não é um defeito que dá para corrigir.
2. Teste em paralelo no Comparar. Rode o mesmo prompt, ainda sem mudanças, em três modelos, por exemplo GPT-5.4, Claude Opus 4.8 e Gemini 3.1 Pro. Leia as três falhas juntas e aplique a tabela acima.
3. Pontue três reescritas no Juiz. Escreva três variantes, cada uma corrigindo uma causa suspeita, e deixe o Juiz classificar contra os seus critérios e explicar o ranking. Você descobre qual mudança pesou de verdade, e essa é a parte que você guarda.
4. Reconstrua no Pipeline. Encadeie Rascunho, Crítica, Revisão e Polimento: um modelo escreve o prompt melhorado, outro ataca as ambiguidades e um terceiro aperta o texto. Prompt responde a edição do mesmo jeito que documento, como mostra como criar um pipeline de IA.
5. Guarde o vencedor em Times. Deixe o prompt final em uma conversa fixa de Time para a próxima pessoa não repetir a investigação inteira. Qual modo usar primeiro está mapeado em quando usar cada modo do aiDex.
Como saber se a reescrita ficou realmente melhor?
Compare com o original nos mesmos modelos e na mesma sessão, não com a sua lembrança de ontem. Rode o antigo e o novo em sequência, com as mesmas entradas, e verifique se o defeito que você anotou no passo um sumiu. Se dois modelos passam a concordar onde antes divergiam, essa convergência é um sinal útil, e como obter consenso de várias IAs explica até onde confiar nela.
Mantenha os critérios por escrito. Uma reescrita mais bonita que continua ignorando o limite de palavras não corrigiu nada.
E se o prompt tiver dados confidenciais?
Depure primeiro em um modelo local. O Ollama roda na sua máquina, então o prompt com problema e os documentos anexados nunca saem dela, e você ainda consegue trabalhar a estrutura antes de levar a versão final para qualquer outro lugar. Use as suas próprias chaves de provedor ou as que a gente gerencia, e escolha os modelos que quiser.
Para o padrão maior em que isso se encaixa, comece por fluxos de trabalho com múltiplos modelos de IA.
A equipe do aiDex · Plataforma de IA multimodelo
O aiDex é uma plataforma de IA multimodelo que permite consultar vários modelos de IA ao mesmo tempo, comparar as respostas, escolher por consenso e encadear modelos em pipelines ou conversas abertas em time. Use as suas próprias chaves de provedor ou as que a gente gerencia, e escolha os modelos que quiser.
Perguntas frequentes
Como saber se o problema é o meu prompt ou o modelo de IA?
Rode o mesmo prompt em dois ou três modelos ao mesmo tempo. Se todos falham do mesmo jeito, a culpa é do prompt. Se um responde bem e os outros não, o prompt está bom e o problema é de escolha de modelo, então mantenha o texto e troque o modelo.
Qual é o motivo mais comum de um prompt falhar?
Falta de contexto. O modelo não enxerga a sua empresa, o seu público nem a decisão por trás do pedido. Acrescentar o pano de fundo que você considera óbvio, junto de um formato de saída claro, resolve boa parte dos prompts na primeira reescrita.
Devo corrigir tudo no prompt de uma vez?
Não. Mude uma coisa por vez e pontue as variantes. Se você reescreve contexto, formato e tom juntos, não descobre qual mudança funcionou e não consegue reaproveitar a lição no próximo prompt.
Quanto tempo leva para depurar um prompt?
Cerca de quinze minutos. Reproduza a falha uma vez, rode o mesmo prompt em três modelos, escreva três reescritas direcionadas, pontue e guarde a vencedora. Mais que isso costuma significar que a tarefa precisa ser dividida em pedidos menores.
Dá para depurar prompts com informação confidencial?
Dá. Rode em um modelo local pelo Ollama, que mantém o prompt e os documentos anexados na sua própria máquina. Você resolve a estrutura localmente e só leva o prompt final para outro lugar se quiser.
Continue lendo
Fluxos de trabalho com IA multimodelo: por que consultar todos os modelos de uma vez (guia de 2026)
Um modelo é uma única opinião. Veja como consultar vários ao mesmo tempo e obter uma resposta melhor.
Como comparar modelos de IA lado a lado
Envie um único prompt para vários modelos de uma vez, leia as respostas lado a lado e deixe o resultado decidir, em vez do hype.
Como obter uma resposta de consenso de várias IAs
Por que uma resposta sintetizada a partir de vários modelos supera um único modelo nas perguntas que realmente importam, e como conseguir isso em dois cliques.
Como criar um pipeline de IA: Rascunho, Crítica, Revisão
Encadeie modelos nas etapas de Rascunho, Crítica e Revisão para que cada passagem melhore a anterior em vez de começar do zero.