Volver al glosario

System prompt leakage

1 min de lectura

El system prompt leakage es la revelación de las instrucciones que una aplicación coloca delante de un modelo de lenguaje: su papel, sus reglas, las descripciones de sus herramientas y cualquier otra cosa que el desarrollador escribiera ahí. Es una entrada de la lista de OWASP para aplicaciones con LLM, y el hallazgo de verdad no suele ser la revelación sino lo que se metió en el prompt.

29 de julio de 2026
Compartir:

Recuperar las instrucciones rara vez es difícil, porque al modelo se le ha dado ese texto y está diseñado para ser servicial con el texto. Las peticiones directas funcionan en despliegues sin fortificar; donde no funcionan, las rutas habituales son pedir una traducción, un resumen o una continuación, solicitar el contenido en un formato raro, o leerlo de un mensaje de error o de un campo de depuración que devuelve la aplicación.

La distinción importante es cuánto cuesta la fuga. Un prompt que solo define el tono y las reglas de rechazo no es sensible, y tratar su revelación como un hallazgo crítico hace perder el tiempo a todo el mundo. Un prompt que contiene una clave de API, un nombre de máquina interno, el identificador de una base de datos, los nombres de las herramientas que el modelo puede invocar o una regla de negocio como un umbral de descuento es otra cosa, y ahí el hallazgo se escribe contra la gestión de secretos y no contra el modelo.

Tratar el prompt como confidencial no es un control viable, porque al modelo se le puede inducir a repetir cualquier cosa que pueda leer. Lo que sí funciona es diseñar para que la revelación sea sobrevivible: credenciales fuera del prompt, autorización aplicada en la capa de herramientas y no solicitada en las instrucciones, y ninguna regla en el prompt que fuera peligrosa si la leyera un usuario. Establecer eso forma parte de las pruebas de IA en las que vamos a por las instrucciones antes que a por nada más, y normalmente es el primer paso de una evaluación de prompt injection.

¿Quieres ver cómo trabajamos en Asperis Security?

Agenda 30 minutos con uno de nuestros especialistas. Revisamos tu stack y te decimos qué conviene probar primero.