Volver al glosario

Tool poisoning

1 min de lectura

El tool poisoning es un ataque en el que la descripción o los metadatos de una herramienta disponible para un agente de IA se escriben para manipular al modelo. Como el agente lee esas descripciones para decidir qué llamar y cómo, la descripción es entrada sin confianza que llega al modelo con la autoridad de una configuración.

29 de julio de 2026
Compartir:

Es indirect prompt injection entregada por un canal que nadie revisa. La definición de una herramienta contiene un nombre, una descripción y un esquema de parámetros, todo texto libre, y todo ello se coloca en el contexto del modelo. Las instrucciones escondidas ahí pueden decirle al agente que llame antes a otra herramienta, que añada datos a un argumento o que ignore una restricción, y llegan antes de que el usuario haya escrito nada.

Hay dos variantes que lo hacen peor de lo que sugeriría una revisión estática. Un servidor puede cambiar la descripción de una herramienta después de que se aprobara y se conectara, así que lo que se auditó el primer día no es lo que el modelo lee el día treinta. Y cuando hay varios servidores conectados a la vez, la descripción de uno puede referirse al comportamiento de otro y redirigirlo, porque el modelo ve una única lista plana y no tiene noción de en qué servidor debería confiar para qué cosa.

De ahí salen los controles. Fija las definiciones de las herramientas y detecta los cambios en vez de traerlas frescas y creértelas; no mezcles en la misma sesión servidores de niveles de confianza distintos; y aplica la autorización en el propio endpoint de la herramienta, para que una llamada manipulada falle igualmente. Cuando evaluamos un agente construido sobre Model Context Protocol leemos todas las descripciones conectadas como texto controlado por el atacante, que es la base de las pruebas de IA que inspeccionan todas las herramientas que un agente tiene permitido llamar.

¿Quieres ver cómo trabajamos en Asperis Security?

Agenda 30 minutos con uno de nuestros especialistas. Revisamos tu stack y te decimos qué conviene probar primero.