IA y LLM
Definiciones en lenguaje claro del tema ia y llm.
Envenenamiento de datos de entrenamiento (Training data poisoning)
En seguridad de IA, el envenenamiento de datos de entrenamiento es la manipulación de los datos con los que se entrena o se ajusta un modelo para que se comporte como pretende el atacante: con un disparador oculto, con un sesgo o con una capacidad degradada. Es un ataque a la cadena de suministro del modelo, y de los que rara vez se cuentan desde la perspectiva de quien lo prueba.
Excessive agency
La excessive agency es la situación en la que a una aplicación construida sobre un modelo de lenguaje se le concede más funcionalidad, más permiso o más autonomía de la que su tarea necesita. Es la entrada de la lista de OWASP para aplicaciones LLM que decide si una inyección con éxito es una respuesta bochornosa o un incidente.
Extracción de modelo (Model extraction)
La extracción de modelo es un ataque en el que se usan consultas repetidas contra un modelo para construir una copia funcional de él. El atacante no llega a tocar los pesos: usa la interfaz como oráculo y recoge pares de entrada y salida hasta que un modelo sustituto reproduce el comportamiento del original con precisión suficiente para servirle.
Indirect prompt injection
En seguridad de IA, la indirect prompt injection es un ataque en el que las instrucciones maliciosas van escondidas en contenido que un LLM lee (una página web, un documento, un registro recuperado, el resultado de una herramienta) en vez de escribirlas el usuario. Cuando el modelo tiene herramientas o memoria, seguir esas instrucciones escondidas deja de ser una curiosidad y pasa a ser un incidente de seguridad.
Inversión de modelo (Model inversion)
La inversión de modelo es un ataque que reconstruye rasgos representativos de los datos con los que se entrenó un modelo, usando solo el acceso a sus salidas. Cuando el conjunto de entrenamiento contenía datos personales, una inversión que funciona convierte un modelo desplegado en una divulgación de esos datos, lo que es un problema de privacidad antes que de seguridad.
Membership inference
La membership inference es un ataque que determina si un registro concreto formó parte del conjunto de entrenamiento de un modelo, observando cómo responde el modelo ante él. Es la pregunta que hace un delegado de protección de datos cuando un modelo se ha entrenado con datos de clientes, porque una respuesta afirmativa es una revelación sobre una persona identificable.
Model Context Protocol (MCP)
En seguridad de IA, el Model Context Protocol (MCP) es un estándar abierto que permite a una aplicación con modelo de lenguaje conectarse a herramientas y datos externos a través de una interfaz común. Es la forma en que un agente de IA adquiere las capacidades con las que actúa, y por tanto donde vive hoy buena parte de la superficie de ataque real de un agente.
Seguridad de agentes de IA (AI agent security)
La seguridad de agentes de IA es la práctica de proteger software que decide por sí mismo su siguiente paso y actúa a través de herramientas, lo que lo convierte en un actor autónomo dentro de tus sistemas y no en una funcionalidad. Cubre la identidad y las credenciales propias del agente, hasta dónde puede llegar, la integridad de su memoria y de sus herramientas, y un registro de todo lo que hizo.
Seguridad de la base de datos vectorial (Vector database security)
La seguridad de la base de datos vectorial cubre los controles sobre el almacén que guarda los embeddings en los que busca una aplicación de generación aumentada por recuperación. Importa porque ese almacén es una copia del contenido original en otra representación, y se construye por rutina sin el control de acceso, la clasificación y las reglas de retención que gobernaban al original.
Shadow AI
En seguridad, el shadow AI es el uso de herramientas de IA dentro de una organización sin aprobación ni supervisión: personas que pegan datos de la empresa en asistentes públicos, equipos que enchufan modelos no autorizados a sus flujos de trabajo. Es el nuevo canal descontrolado de fuga de datos, y es lo que deja anticuada la vieja idea de la prevención de pérdida de datos.
System prompt leakage
El system prompt leakage es la revelación de las instrucciones que una aplicación coloca delante de un modelo de lenguaje: su papel, sus reglas, las descripciones de sus herramientas y cualquier otra cosa que el desarrollador escribiera ahí. Es una entrada de la lista de OWASP para aplicaciones con LLM, y el hallazgo de verdad no suele ser la revelación sino lo que se metió en el prompt.