Volver al glosario

Adversarial example

1 min de lectura

Un adversarial example es una entrada construida con una perturbación pequeña y deliberada que hace que un modelo de aprendizaje automático produzca una salida errónea sin que una persona aprecie cambio alguno. Es el ataque clásico contra clasificadores, y sigue siendo lo que importa allí donde un modelo toma una decisión de seguridad.

29 de julio de 2026
Compartir:

La perturbación se calcula, no se adivina. Con acceso a los gradientes del modelo, un atacante puede calcular el cambio más pequeño que empuja una entrada al otro lado de una frontera de decisión, y las versiones iterativas de ese cálculo producen ejemplos extremadamente fiables. Sin ese acceso se llega muchas veces al mismo resultado por transferencia: se construye el ejemplo contra un modelo sustituto entrenado para la misma tarea y una proporción aprovechable de esos ejemplos funciona también contra el objetivo.

En un contexto de seguridad, los modelos interesantes son los que deciden cosas. Un clasificador de malware, un motor de puntuación de fraude, un paso de verificación documental o de identidad, un filtro de contenido: cada uno es un modelo cuya respuesta equivocada tiene una consecuencia directa, y cada uno es un objetivo que devuelve información al atacante en cada intento. El mismo razonamiento se aplica al clasificador que se coloca delante de un modelo de lenguaje a modo de guardrails, y por eso un filtro basado en un modelo se puede atacar de una forma en que no se puede atacar una regla.

Las defensas reducen la tasa, no cierran la categoría. La forma honesta de plantearlo ante un cliente es que un modelo usado como control de seguridad se puede optimizar en su contra, así que su sitio está detrás de algo determinista y no delante. Eso es distinto de un jailbreak, que manipula instrucciones en lugar de entradas numéricas, y las dos cosas caen dentro del pentesting de IA, que incluye los clasificadores y no solo la interfaz de chat.

¿Quieres ver cómo trabajamos en Asperis Security?

Agenda 30 minutos con uno de nuestros especialistas. Revisamos tu stack y te decimos qué conviene probar primero.