Tu Prompt No Funciona: Cómo Depurarlo Con Tres Modelos
Una rutina de quince minutos que te dice si reescribir el prompt o cambiar de modelo.
Resumen
Lanza el prompt fallido a dos o tres modelos a la vez. Si todos fallan igual, el problema es el prompt, y suele ser falta de contexto, falta de formato de salida, dos tareas en una sola petición o ausencia de criterios de éxito. Si uno acierta, mantén el prompt y cambia el modelo.
¿El problema es el prompt o el modelo?
Envía el mismo prompt a dos o tres modelos a la vez y lee los fallos juntos. Si todos fallan igual, el problema es el prompt. Si uno acierta y los demás no, el prompt está bien y lo que tienes es un problema de elección de modelo.
Esa única prueba elimina casi todas las conjeturas. En aiDex, Comparar lanza un solo prompt a varios modelos en paralelo y coloca las respuestas una al lado de la otra, así que el patrón aparece en una sola pantalla en lugar de en tres pestañas. El recorrido completo está en cómo comparar modelos de IA.
| Lo que ves | Lo que significa | Qué cambiar |
|---|---|---|
| Todos fallan de la misma forma | Problema de prompt | Añade contexto, formato, criterios |
| Cada uno responde algo distinto | Prompt ambiguo | Acota alcance y formato |
| Uno acierta y los demás no | Elección de modelo | Mantén el prompt, cambia el modelo |
| Respuestas correctas pero inservibles | Problema de formato | Pide extensión y estructura |
¿Qué suele romper un prompt?
Cuatro cosas, más o menos en el orden en que aparecen.
Falta de contexto. El modelo no ve tu empresa, tu cliente ni la decisión de la semana pasada. La recomendación de Anthropic es tratarlo como a un colega con talento en su primer día: necesita, por escrito, el trasfondo que tú das por supuesto (documentación de prompt engineering de Anthropic).
Ningún formato de salida. "Escribe sobre nuestros precios" no tiene formato. "Escribe 120 palabras, en tres viñetas, para un director financiero que nunca nos ha oído nombrar" sí lo tiene. El formato es lo que convierte una respuesta correcta en una respuesta utilizable.
Dos tareas en una sola petición. Análisis, reescritura y recomendación en el mismo prompt suelen dar una versión floja de las tres. Sepáralas en turnos distintos.
Ningún criterio de éxito. Si no has dicho cómo es una buena respuesta, no puedes señalar el fallo al modelo ni comparar dos reescrituras entre sí.
La guía de OpenAI hace un apunte parecido sobre dónde va cada cosa: el rol y el tono, en el mensaje de sistema; la tarea, las restricciones y los ejemplos, en el mensaje del usuario (guía de prompt engineering de OpenAI).
¿Cómo depuro un prompt paso a paso?
Cinco pasos, unos quince minutos.
1. Reprodúcelo en Solo. Lanza el prompt fallido una vez, sin tocar nada, y anota el defecto concreto: alcance equivocado, dato inventado, tono equivocado, demasiado largo. "Salió mal" no es un defecto que puedas arreglar.
2. Prueba en paralelo con Comparar. Lanza el mismo prompt, todavía sin cambios, en tres modelos, por ejemplo GPT-5.4, Claude Opus 4.8 y Gemini 3.1 Pro. Lee los tres fallos juntos y aplica la tabla de arriba.
3. Puntúa tres reescrituras con Judge. Escribe tres variantes, cada una corrigiendo una causa sospechosa, y deja que Judge las ordene según tus criterios y explique el ranking. Descubres qué cambio pesó de verdad, y esa es la parte que te quedas.
4. Reconstrúyelo en Pipeline. Encadena Borrador, Crítica, Revisión y Pulido: un modelo escribe el prompt mejorado, otro ataca sus ambigüedades y un tercero lo aprieta. Un prompt responde a la edición igual que un documento, como cuenta cómo crear un pipeline de IA.
5. Guarda el ganador en Equipos. Deja el prompt final en una conversación fija de Equipo para que la siguiente persona no repita toda la investigación. Qué modo usar primero está en cuándo usar cada modo de aiDex.
¿Cómo sé que la reescritura es realmente mejor?
Compárala con el original en los mismos modelos y en la misma sesión, no con tu recuerdo de ayer. Lanza la versión vieja y la nueva seguidas, con las mismas entradas, y comprueba si el defecto que anotaste en el paso uno ha desaparecido. Si dos modelos ahora coinciden donde antes divergían, esa convergencia es una señal útil, y cómo obtener consenso de varias IAs explica hasta dónde fiarse.
Mantén los criterios por escrito. Una reescritura más bonita que sigue ignorando tu límite de palabras no ha arreglado nada.
¿Y si el prompt lleva datos confidenciales?
Depúralo primero contra un modelo local. Ollama se ejecuta en tu propia máquina, así que el prompt problemático y los documentos adjuntos nunca salen de ahí, y aún puedes trabajar la estructura antes de llevar la versión final a ningún otro sitio. Usa tus propias claves de proveedor o las que gestionamos nosotros, y elige los modelos que quieras.
Para el patrón más amplio en el que encaja esto, empieza por flujos de trabajo con múltiples modelos de IA.
El equipo de aiDex · Plataforma de IA multimodelo
aiDex es una plataforma de IA multimodelo que te permite consultar varios modelos de IA a la vez, comparar sus respuestas, elegir por consenso y encadenar modelos en pipelines o conversaciones abiertas en equipo. Usa tus propias claves de proveedor o las que gestionamos nosotros, y elige los modelos que quieras.
Preguntas frecuentes
¿Cómo sé si el problema es mi prompt o el modelo de IA?
Lanza el mismo prompt a dos o tres modelos a la vez. Si todos fallan igual, la culpa es del prompt. Si uno responde bien y los demás no, el prompt está bien y el problema es de elección de modelo, así que conserva el texto y cambia el modelo.
¿Cuál es el motivo más común de que un prompt falle?
La falta de contexto. El modelo no ve tu empresa, tu público ni la decisión detrás de la petición. Añadir el trasfondo que das por supuesto, junto con un formato de salida claro, arregla buena parte de los prompts en la primera reescritura.
¿Debo corregir todo el prompt de una vez?
No. Cambia una cosa cada vez y puntúa las variantes. Si reescribes contexto, formato y tono a la vez, no averiguas qué cambio funcionó y no puedes reutilizar la lección en el siguiente prompt.
¿Cuánto debería tardar en depurar un prompt?
Unos quince minutos. Reproduce el fallo una vez, lanza el mismo prompt a tres modelos, escribe tres reescrituras dirigidas, puntúalas y conserva la ganadora. Más tiempo suele indicar que la tarea necesita dividirse en peticiones más pequeñas.
¿Puedo depurar prompts con información confidencial?
Sí. Lánzalos contra un modelo local con Ollama, que mantiene el prompt y los documentos adjuntos en tu propia máquina. Puedes resolver la estructura en local y llevar el prompt final a otro sitio solo si quieres.
Sigue leyendo
Flujos de trabajo de IA multimodelo: por qué consultar todos los modelos a la vez (guía de 2026)
Un modelo es una sola opinión. Aquí tienes cómo consultar varios a la vez y obtener una respuesta mejor.
Cómo comparar modelos de IA en paralelo
Envía un mismo prompt a varios modelos a la vez, lee las respuestas en paralelo y deja que decida el resultado, no el ruido.
Cómo obtener una respuesta de consenso a partir de varias IA
Por qué una respuesta sintetizada a partir de varios modelos supera a un solo modelo en las preguntas que de verdad importan, y cómo conseguirla en dos clics.
Cómo crear un pipeline de IA: Borrador, Crítica, Revisión
Encadena modelos en las etapas de Borrador, Crítica y Revisión para que cada pasada mejore la anterior en lugar de empezar de cero.