PENTESTING DE SISTEMAS DE IA

Descubre qué expone de verdad tu sistema de IA.

Tus copilotos, tus pipelines RAG y tus agentes ya ven datos de clientes, código fuente y políticas internas. Demostramos cómo un atacante, o un empleado que confía demasiado, convierte ese acceso en una brecha. Antes de que acabe en el buzón de un regulador.

Cómo funciona un pentesting de IA
87%
de nuestros clientes renuevan cada año
150+
organizaciones en varios países de Europa
7/10
nos confirman hallazgos que su anterior proveedor no encontró
¿Quieres saber qué expone de verdad tu stack de IA? Cuéntanos tu principal preocupación y déjanos tu email.

Protegido por reCAPTCHA. Se aplican la Política de Privacidad y las Condiciones del Servicio de Google.

Nos eligen equipos de IA y de plataforma en entornos muy regulados

Descubre cómo un atacante lleva a tu IA hasta los datos de tus clientes.

demo de pentesting de IA
OBJETIVO · LLEGAR A LOS DATOS DE OTROS CLIENTES
vector store · sin comprobacion de namespaceautenticado como acme · devuelve documentos de northwindEN VIVO
GET/v1/rag/retrieve?q=invoice&top_k=5
Authorization:Bearer eyJ… [tenant=acme]
doc_idtenanttitlescore
doc_8841acmeInvoice #44210.92
doc_2210globexInvoice #22100.88
doc_5512initechPayroll Q30.81
EXFILel tenant_id no se compara al recuperar
ACME COPILOT · VISTA DEL CLIENTE
Busca documentos de la factura #4421
También he encontrado documentos de Globex y de Initech.
Hay otros tenants en la respuesta.
LO QUE VE EL CLIENTE
IA → SALTO ENTRE TENANTS 5 SALTOS · ~18 MIN
leaksystem prompt y 4 herramientas revelados con una pregunta educada
injectuna nota al pie del PDF reescribió el objetivo del agente · guardrail sorteado
rag/v1/rag/retrieve · facturas, nóminas y contratos filtrados
·toolrefund() aprobado sin nadie delante · 12.840 EUR al IBAN del atacante
·tenantun solo prompt · 18.421 usuarios enumerados de punta a punta

La IA que corre en tus sistemas solo es tan buena como los datos con los que se alimenta, y tan segura como el acceso que la rodea. Nosotros probamos desde el punto de vista de un atacante: qué datos puede manipular para engañar al modelo, qué acceso tiene al servidor de la IA, qué secretos están en el contenedor, y cómo se comunica con los sistemas que la rodean. La cadena completa.

QUÉ PROBAMOS
  • Prompt injection directa e indirecta
  • Fuga de datos sensibles por contexto y RAG
  • Extracción de system prompt y políticas
  • Exceso de autonomía en agentes y herramientas
  • Vulnerabilidades en vectores y embeddings
  • Cadena de suministro: modelos, frameworks, MCP
  • Envenenamiento de datos y de modelos
  • Consumo sin límite y abuso de coste

Por qué un CTO, CISO o responsable de plataforma contrata un pentesting de IA.

Un pentesting de IA se contrata casi siempre porque algo lo ha forzado: el ritmo de los releases, la petición de un cliente grande, el plazo de un regulador, un susto en producción o una due diligence de M&A.

TOCA UNA SITUACIÓN
Consejo y cliente Segunda opinión sobre el proveedor actual

Alguien con autoridad ha preguntado, y «vamos bien» no es una respuesta.

Cuando lo que piden son garantías sobre la exposición de tu IA, necesitas un pentesting de IA externo y dirigido por especialistas, y un entregable que traduzca cada hallazgo a impacto en el negocio para alguien no técnico.

  • Resumen ejecutivo que se entiende sin traducción
  • Hallazgos ordenados por impacto en el negocio y exposición ante auditoría
  • Una redacción que el departamento de compras de una gran cuenta acepta
  • Independencia: externo y dirigido por especialistas de principio a fin
Normativa y auditoría Auditoría OWASP Top 10 for LLM Apps

Un auditor no acepta una demo de jailbreak.

Con el OWASP Top 10 for LLM Apps, la ISO/IEC 42001 o el Reglamento Europeo de IA en juego, el informe tiene que aguantar el escrutinio: alcance trazable, metodología mapeada a estándares reconocidos y retest firmado.

  • Metodología mapeada al OWASP Top 10 for LLM Apps y a la OWASP AI Testing Guide
  • Evidencia con el formato que esperan la ISO/IEC 42001, el Reglamento Europeo de IA y el regulador
  • Certificado de ejecución listo para la carpeta del auditor
  • Evidencia de retest con marca de tiempo, la versión del modelo fijada y firma
Por incidente Un cliente ve respuestas de otro cliente

Algo no cuadraba. Necesitas saber qué sigue expuesto.

La pregunta ya no es «¿tenemos hallazgos?» sino «¿hay más caminos?». Centramos el proyecto en la exposición que se sospecha, confirmamos que está cerrada y sacamos los caminos contiguos a los que un atacante podría saltar.

  • Alcance dirigido a la exposición que se sospecha
  • Caminos contiguos mapeados: prompts, recuperación, herramientas, agentes y cadena de suministro del modelo
  • Pruebas de concepto reproducibles para el equipo de respuesta a incidentes
  • Hallazgos en vivo para quien responde, no en el informe final
Releases y cambios Una fuente RAG nueva entra en producción

Tu IA sale cada semana. Valida el cambio antes de que salga.

El momento más barato para validar es el del cambio, mientras tu equipo todavía tiene el contexto en la cabeza. Probamos la superficie nueva, demostramos qué caminos existen y hacemos retest de la diferencia tras la corrección.

  • Alcance ajustado a lo que sale: la diferencia contra el modelo, el prompt y las herramientas anteriores
  • Prompts, recuperación, permisos de herramientas y fronteras entre tenants puestos a prueba
  • Hallazgos críticos comunicados en vivo, para corregir a mitad de release
  • El retest cierra el caso, no el informe
Por caso de uso Modelo o framework vulnerable en uso

El caso de uso decide el modelo de amenazas, así que la prueba sigue al caso de uso.

Un copiloto, un agente con permisos de escritura y un chatbot público fallan de formas distintas. Acotamos al tuyo y demostramos el camino desde lo que cualquier usuario ya puede enviar hasta el dato que debía quedar fuera de su alcance.

  • Modelo de amenazas escrito para tu caso de uso, no un checklist genérico de prompt injection
  • Aislamiento por tenant y namespaces de la recuperación, probados con documentos reales
  • Permisos de herramientas y agentes probados contra el mínimo privilegio, escrituras incluidas
  • Modelos, frameworks y servidores MCP revisados como parte de la superficie

¿Listo para ver qué expone de verdad tu IA?

Reservar una llamada
Treinta minutos con un pentester de IA experimentado.

Un método de siete fases para el pentesting de tu IA.

Siete fases, en orden. Cada una termina con algo demostrado, no con algo supuesto.

Un pentesting de IA que va más allá del checklist.

Refuerza la seguridad de tu IA con auditorías manuales dirigidas por especialistas, no con demos de jailbreak para rellenar una casilla.

Manual, no automático.

Un pentester de IA senior recorre a mano cada cadena contra tus modelos, tus prompts, tu RAG y tus herramientas. Sin ruido de escáner.

Simulación de un atacante real.

Demostramos, o descartamos, el camino desde un chat público hasta una herramienta que no deberíamos poder ejecutar y hasta datos que no deberíamos ver.

Informe alineado con OWASP LLM.

Cada hallazgo mapeado al OWASP Top 10 for LLM Apps (2025): el documento que leen tu auditor y el departamento de compras de tu cliente.

Retest atado a la versión del modelo.

Tras una corrección, o un cambio de modelo o de prompt, hacemos retest de la diferencia contra la misma versión, el mismo índice RAG y la misma configuración de herramientas.

¿Quieres ver la pinta que tendría tu próximo pentesting de IA con nosotros?

Desde Etnia valoramos muy positivamente la colaboración con Asperis Security.
Sergi Leno, Responsable de Sistemas · ETNIA Barcelona

Nos eligen los equipos de ingeniería y de seguridad.

Informes que tus ingenieros de ML leen de verdad y que el departamento de compras de tus clientes acepta de verdad. Con nombre, cargo y empresa reales.

Desde Etnia valoramos muy positivamente la colaboración con Asperis Security. Su profesionalidad, cercanía, rapidez de respuesta y capacidad para adaptarse a nuestras necesidades han sido clave en cada proyecto. La calidad del servicio y el acompañamiento continuo nos aportan siempre mucha tranquilidad. Sin duda, es un placer contar con ellos como partners tecnológicos.
Sergi Leno, Responsable de Sistemas
ETNIA Barcelona
ASPERIS nos ha acompañado en la definición e implantación de nuestro roadmap de ciberseguridad en Microsoft 365 con un enfoque estructurado y alineado a negocio. Gracias a su asesoramiento, dimos el paso estratégico de completar nuestro ecosistema Microsoft y reforzarlo con CrowdStrike para la protección avanzada de dispositivos móviles, elevando de forma significativa nuestro nivel de seguridad.
Jordi Bondia, Director de TI
SALVI
En NPAW hemos colaborado con Asperis en distintas iniciativas relacionadas con la seguridad y la experiencia ha sido muy positiva. Valoramos especialmente su capacidad para adaptarse a nuestras necesidades y el nivel de profundidad con el que abordan cada proyecto. Los resultados son claros, estructurados y útiles para la toma de decisiones y la mejora continua en seguridad. Nos gusta trabajar con Asperis por el criterio y el valor que aportan en cada colaboración. Su trabajo nos ha ayudado a reforzar nuestro nivel de seguridad.
Sergi Laencina Verdaguer, CISO
NPAW
Con Asperis no contratas un servicio, contratas un compañero. No buscan facturar un proyecto, buscan establecer una relación de confianza preocupándose por los puntos clave que afectan a la seguridad de tu organización. Profesionalidad, saber hacer y diligencia.
Juan Valer Tecedor, Ingeniero de Software
GNOSS
CUANDO TÚ QUIERAS

¿Quieres un alcance de IA de verdad?

Te responderá un consultor experimentado.

Las preguntas que salen antes de firmar.

Un pentesting web o de API trata la IA como un endpoint más detrás de tu stack. Un pentesting de IA trata el modelo, los prompts, el RAG, las herramientas y los permisos como el producto: instrucciones, contexto, recuperación, orquestación de agentes, proveedores de modelo y cadena de suministro entran todos en el alcance. No es un subconjunto, es otra superficie. El mismo producto puede pasar un pentesting web y de API sin un solo hallazgo y seguir teniendo una prompt injection indirecta en un PDF subido que dispara una herramienta de devoluciones, o un índice RAG que devuelve los documentos de otro cliente con una sola pregunta en lenguaje natural. La mayoría de las empresas reguladas que publican un producto con LLM hacen los dos: un pentesting web o de API atado al ciclo de release del front y del gateway, y un pentesting de IA atado a las versiones del modelo, a los prompts, a las herramientas y a las fuentes del RAG.

Un pentesting de IA cubre el modelo y también sus prompts, su contexto, sus fuentes RAG, sus agentes y sus herramientas, no solo el endpoint que publica tu equipo de web. Auditamos prompt injection directa, prompt injection indirecta a través de documentos que leen tus agentes, extracción del system prompt y de las políticas, integridad del índice RAG y recuperación entre tenants, permisos de las llamadas a herramientas y exceso de autonomía, vulnerabilidades del almacén de vectores y de los embeddings, riesgos de cadena de suministro en conectores y servidores MCP, y abuso de consumo de tokens o de coste. Cada hallazgo se encadena hasta su impacto en el negocio y se mapea al OWASP Top 10 for LLM Apps (2025).

Un pentesting de IA se presupuesta por alcance, complejidad y tipo de prueba. Te damos una propuesta a precio cerrado en las 48 horas siguientes a la primera llamada, sin costes ocultos y sin compromiso de renovación. Auditar un solo chatbot con un índice RAG documentado queda en la parte baja del rango. Las plataformas con varios agentes, los despliegues RAG multi-tenant o los proyectos que necesitan montar un arnés específico para un modelo propio escalan desde ahí. El retest siempre va incluido, contra la misma versión del modelo y la misma configuración de prompts.

No sin tu consentimiento. Cada pentesting de IA se entrega con rules of engagement por escrito, criterios de ataque seguro y un protocolo de hallazgo crítico: qué superficies entran en el alcance (preproducción o un tenant de producción controlado), qué herramientas se pueden ejecutar en vivo y qué obliga a parar de inmediato. Sobre proveedores de modelo gestionados trabajamos por defecto con una clave de API en sandbox, con un tope de peticiones y un presupuesto de tokens que acuerdas por adelantado, para que probar el abuso de coste sea una prueba medida y no una barra libre. Cualquier explotación sobre producción exige tu aprobación por escrito y que tu equipo esté pendiente.

El black box refleja lo que tendría un cliente o un investigador curioso: el chat público, un documento subido y una pregunta educada. El grey box añade tus system prompts, tu lista de herramientas, el inventario de fuentes del RAG, un tenant de pruebas y un contacto técnico para dudas, así que dedicamos más tiempo del proyecto a encadenar y menos a descubrir. El white box añade diagramas de arquitectura, configuración del modelo, librerías de prompts y documentos de diseño de conectores o de servidores MCP. Normalmente recomendamos grey box para el primer proyecto y para los ciclos siguientes, a medida que tu producto de IA madura, y black box cuando lo que buscas es una señal para la auditoría de un cliente o volver a fijar la línea base de un chatbot público.

El hacker ético senior con el que hablas en la primera llamada. Nuestro equipo cuenta con credenciales OSCP, OSCE³, OSWE, OSEP, CRTO y CRTP, y en la práctica de IA sumamos conocimiento específico de LLM (OWASP Top 10 for LLM Apps 2025, MITRE ATLAS, OWASP AI Testing Guide) y experiencia real con modelos GPT, Claude, Llama y Mistral y con los frameworks de orquestación habituales (LangChain, LlamaIndex, servidores MCP). Somos contribuidores verificados del Bug Bounty de la NASA, y nuestro equipo ha publicado investigación contra cadenas de herramientas de IA muy desplegadas. Tu proyecto lo acota, lo ejecuta y lo re-verifica el mismo especialista con el que hablaste el primer día. Y sigues hablando con esa misma persona en cada fase.

¿Listo para reducir el riesgo de tus agentes?

Revisaremos tu stack de IA (canales, modelos, prompts, RAG, agentes, herramientas y permisos) y te ayudaremos a definir el pentesting de IA adecuado antes de empezar el proyecto.

Pide una propuesta de pentesting de IA.
Te responde un pentester de IA experimentado en un día laborable. Te atiende quien hace las pruebas.

Protegido por reCAPTCHA. Se aplican la Política de Privacidad y las Condiciones del Servicio de Google.

O escribe directamente a [email protected].

NUESTROS CLIENTES YA LO HAN HECHO

Desde Etnia valoramos muy positivamente la colaboración con Asperis Security.

Sergi Leno, Responsable de Sistemas
ETNIA Barcelona

ASPERIS nos ha acompañado en la definición e implantación de nuestro roadmap de ciberseguridad en Microsoft 365 con un enfoque estructurado y alineado a negocio.

Jordi Bondia, Director de TI
SALVI

En NPAW hemos colaborado con Asperis en distintas iniciativas relacionadas con la seguridad y la experiencia ha sido muy positiva.

Sergi Laencina Verdaguer, CISO
NPAW

Con Asperis no contratas un servicio, contratas un compañero.