Pentesting de IA cuando la conversación también es superficie de ataque
Evaluamos aplicaciones basadas en LLM, chatbots, agentes, RAG, APIs e integraciones desde una perspectiva ofensiva. El objetivo no es únicamente comprobar si el modelo “responde bien”, sino determinar qué información puede revelar, qué controles puede eludir y qué acciones podría desencadenar a través de los sistemas conectados.
No evaluamos solamente al modelo: evaluamos el sistema completo
En aplicaciones modernas de IA, una conversación puede atravesar múltiples fronteras de confianza antes de producir una respuesta. El riesgo puede aparecer en el modelo, los datos, las herramientas conectadas o en una API tradicional que el agente consume.
Prompts y comportamiento
Prompt injection directa e indirecta, extracción de instrucciones, jailbreaks, evasión de restricciones y manipulación progresiva del contexto conversacional.
Datos, RAG y contexto
Información sensible, recuperación de documentos, límites entre usuarios, embeddings, fuentes externas y contenido que puede influir en las respuestas.
Agencia y herramientas
Funciones internas, conectores, agentes, llamadas a herramientas, permisos y capacidad del sistema para ejecutar acciones que excedan la intención del usuario.
Aplicación, APIs y cloud
Autenticación, autorización, objetos, secretos, almacenamiento, infraestructura, servicios externos y lógica de negocio que soportan el ecosistema de IA.
Seguimos la conversación hasta donde realmente puede llegar
Un chatbot aislado tiene un impacto distinto a un agente conectado a repositorios, CRMs, sistemas financieros, APIs internas o funciones privilegiadas. Por eso el análisis se centra en la cadena completa de decisión y ejecución.
Una mirada puede decir mucho. Una prueba ofensiva revela mucho más.
El pentesting de IA combina fundamentos de seguridad de aplicaciones y APIs con pruebas específicas para sistemas generativos: lenguaje natural malicioso, manipulación de contexto, exposición de datos, abuso de herramientas y comportamiento adversarial.
El objetivo es transformar comportamientos inesperados en evidencia reproducible, determinar su impacto y diferenciar un simple resultado extraño de una vulnerabilidad que puede comprometer datos, usuarios o procesos.
- Pruebas autorizadas y controladas sobre casos de uso reales.
- Validación manual más allá de listas automáticas de prompts.
- Correlación entre capa IA, APIs, identidad y lógica de negocio.
- Hallazgos documentados para equipos técnicos y responsables de riesgo.
Riesgos específicos de LLM integrados con seguridad tradicional
Utilizamos OWASP Top 10 for LLM Applications como una de las referencias para estructurar cobertura, pero el alcance se adapta a la arquitectura real. Un sistema con RAG, agentes o tools requiere pruebas diferentes a un chatbot aislado.
Prompt Injection
Validamos si entradas directas o indirectas pueden modificar instrucciones, controles o comportamiento esperado del sistema.
Sensitive Information Disclosure
Buscamos exposición de información sensible procedente del contexto, datos, integración o comportamiento de la aplicación.
Improper Output Handling
Comprobamos si las respuestas del modelo son confiadas por otras capas sin validación suficiente y pueden provocar efectos secundarios.
Excessive Agency
Evaluamos si un agente dispone de herramientas, permisos o autonomía superiores a las necesarias para su función.
System Prompt Leakage
Analizamos exposición de instrucciones internas y, especialmente, si esas instrucciones contienen información que pueda facilitar ataques posteriores.
Vector & Embedding Weaknesses
Revisamos riesgos derivados de recuperación, segmentación, contexto compartido, documentos y mecanismos utilizados por arquitecturas RAG.
Dependiendo del sistema también se evalúan riesgos de supply chain, data/model poisoning, misinformation y unbounded consumption, además de las vulnerabilidades convencionales de aplicación, API, cloud e identidad que puedan formar parte de una cadena de ataque.
Cuando una conversación se convierte en un vector de ataque
En una evaluación reciente sobre una plataforma de IA generativa, nuestro equipo identificó múltiples vías de exposición que permitían reconstruir información sobre la arquitectura interna, herramientas conectadas y mecanismos operativos del sistema.
La investigación mostró por qué el riesgo no reside únicamente en el modelo: una conversación podía servir como reconocimiento, revelar el system prompt, enumerar herramientas y lógica operacional y, al continuar hacia las APIs asociadas, encontrar también una debilidad BOLA de autorización.
De la arquitectura a una evidencia reproducible
Evitamos convertir el assessment en una colección indiscriminada de prompts. Las pruebas parten de la arquitectura, los activos y el impacto esperado para construir hipótesis, validar rutas y documentar riesgos que puedan reproducirse.
Modelado de superficie
Identificamos modelo, proveedores, RAG, APIs, tools, agentes, identidades, fuentes de datos y fronteras de confianza relevantes para el caso de uso.
Pruebas adversariales
Diseñamos entradas y secuencias orientadas a modificar comportamiento, extraer contexto, abusar capacidades y comprobar controles del sistema.
Correlación técnica
Extendemos los hallazgos hacia APIs, autorización, datos, herramientas y backend para determinar si existe una cadena de explotación real.
Remediación y re-test
Priorizamos controles aplicables a la causa raíz y verificamos posteriormente si la exposición fue efectivamente reducida sin romper la funcionalidad.
Casos donde un pentest de IA aporta información que un pentest tradicional puede no revelar
Chatbots con datos internos
Asistentes que consultan documentación, clientes, operaciones o información empresarial mediante RAG u otras fuentes privadas.
Agentes con capacidad de acción
Sistemas capaces de invocar herramientas, ejecutar funciones, crear registros, modificar datos o interactuar con procesos de negocio.
Copilotos y asistentes internos
Aplicaciones corporativas con acceso a repositorios, correo, CRM, código, bases documentales, tickets u otros activos empresariales.
Nuevos flujos o integraciones IA
Antes de producción o después de incorporar modelos, agentes, tools, RAG, proveedores externos o nuevas capacidades privilegiadas.
El resultado debe explicar qué ocurrió y dónde corregirlo
Los hallazgos se documentan con contexto técnico y de negocio para evitar recomendaciones genéricas como “mejorar el prompt”. La remediación debe actuar sobre la capa que realmente origina el riesgo.
¿Su IA solamente conversa o también tiene acceso a su organización?
Definimos una evaluación controlada según el modelo, los datos, las herramientas, las APIs y el nivel de autonomía de su aplicación o agente.