Volver al glosario

Guardrails

2 min de lectura

En seguridad de IA, los guardrails son los controles de entrada y de salida que se ponen alrededor de un modelo de lenguaje para bloquear contenido no deseado: filtros que criban los prompts, comprobaciones que inspeccionan las respuestas y políticas que acotan el comportamiento. Son el control que el cliente cree que le protege, y explicar por qué un filtro no arregla un problema estructural es justamente el ángulo ofensivo.

29 de julio de 2026
Compartir:

Cómo funciona

Los guardrails se sitúan en los bordes del modelo. Del lado de la entrada criban los prompts en busca de contenido no permitido, de patrones de jailbreak conocidos o de datos sensibles, antes de que el modelo los vea. Del lado de la salida inspeccionan la respuesta en busca de incumplimientos de política, secretos filtrados o instrucciones peligrosas, antes de que llegue al usuario o a una herramienta aguas abajo. Unos son simples filtros de palabras clave o de expresiones regulares; otros son modelos clasificadores aparte, entrenados para detectar contenido problemático. Bien usados, reducen la tasa de abuso evidente y cazan filtraciones accidentales. Son una capa útil, del mismo modo que un web application firewall es una capa útil delante de una aplicación web.

Qué sale mal

El error es tratar los guardrails como el control de seguridad y no como un filtro puesto encima de una vulnerabilidad estructural. Un filtro por coincidencia de patrones se esquiva reformulando, codificando o repartiendo una petición entre varios turnos; un clasificador tiene sus propios puntos ciegos. Y más importante: los guardrails no hacen nada con el problema de diseño que hay debajo. Si el modelo está cableado a una herramienta que puede mover dinero y se le engaña con una inyección de prompt indirecta, el filtro de salida no llega a ver la acción, solo el texto. Desde el lado del atacante, un guardrail es un obstáculo que se rodea, no un muro, y los sistemas que más se apoyan en filtros suelen ser los que se saltaron el paso de acotar lo que el modelo tiene permitido hacer.

Dónde aparece esto en una auditoría

Probamos los guardrails como filtros e informamos con honestidad de su tasa de esquiva, pero el hallazgo importante es a qué llega el modelo cuando una esquiva funciona: la excessive agency (un modelo al que se le han dado más herramientas y permisos de los que la tarea necesita) convierte un fallo del filtro en impacto real. Dejamos anotado qué controles existen, cómo se esquivaron y qué podía hacer la esquiva que funcionó. La recomendación es casi siempre acotar primero la capacidad y filtrar después. Esto forma parte de cómo probamos los controles frente a ataques reales.

¿Quieres ver cómo trabajamos en Asperis Security?

Agenda 30 minutos con uno de nuestros especialistas. Revisamos tu stack y te decimos qué conviene probar primero.