Pentesting IA

Pentesting · Inteligencia Artificial · LLM

Pentesting de IA cuando la conversación también es superficie de ataque

Evaluamos aplicaciones basadas en LLM, chatbots, agentes, RAG, APIs e integraciones desde una perspectiva ofensiva. El objetivo no es únicamente comprobar si el modelo “responde bien”, sino determinar qué información puede revelar, qué controles puede eludir y qué acciones podría desencadenar a través de los sistemas conectados.

Superficie de ataque IA

No evaluamos solamente al modelo: evaluamos el sistema completo

En aplicaciones modernas de IA, una conversación puede atravesar múltiples fronteras de confianza antes de producir una respuesta. El riesgo puede aparecer en el modelo, los datos, las herramientas conectadas o en una API tradicional que el agente consume.

01

Prompts y comportamiento

Prompt injection directa e indirecta, extracción de instrucciones, jailbreaks, evasión de restricciones y manipulación progresiva del contexto conversacional.

02

Datos, RAG y contexto

Información sensible, recuperación de documentos, límites entre usuarios, embeddings, fuentes externas y contenido que puede influir en las respuestas.

03

Agencia y herramientas

Funciones internas, conectores, agentes, llamadas a herramientas, permisos y capacidad del sistema para ejecutar acciones que excedan la intención del usuario.

04

Aplicación, APIs y cloud

Autenticación, autorización, objetos, secretos, almacenamiento, infraestructura, servicios externos y lógica de negocio que soportan el ecosistema de IA.

Límites de confianza

Seguimos la conversación hasta donde realmente puede llegar

Un chatbot aislado tiene un impacto distinto a un agente conectado a repositorios, CRMs, sistemas financieros, APIs internas o funciones privilegiadas. Por eso el análisis se centra en la cadena completa de decisión y ejecución.

Usuario Prompt, archivo, voz o contenido externo.
Aplicación Frontend, sesión, identidad y controles previos.
LLM System prompt, contexto y decisiones del modelo.
RAG Fuentes, documentos, embeddings y recuperación.
Tools Agentes, funciones, conectores y capacidades.
Backend APIs, datos, cloud y sistemas críticos.
La pregunta importante no es solo qué puede decir la IA. Es qué información puede obtener, qué herramientas puede descubrir y qué sistemas puede alcanzar a partir de una interacción controlada por el usuario.
Pentesting IA explicado

Una mirada puede decir mucho. Una prueba ofensiva revela mucho más.

El pentesting de IA combina fundamentos de seguridad de aplicaciones y APIs con pruebas específicas para sistemas generativos: lenguaje natural malicioso, manipulación de contexto, exposición de datos, abuso de herramientas y comportamiento adversarial.

El objetivo es transformar comportamientos inesperados en evidencia reproducible, determinar su impacto y diferenciar un simple resultado extraño de una vulnerabilidad que puede comprometer datos, usuarios o procesos.

  • Pruebas autorizadas y controladas sobre casos de uso reales.
  • Validación manual más allá de listas automáticas de prompts.
  • Correlación entre capa IA, APIs, identidad y lógica de negocio.
  • Hallazgos documentados para equipos técnicos y responsables de riesgo.
OWASP Top 10 for LLM Applications 2025

Riesgos específicos de LLM integrados con seguridad tradicional

Utilizamos OWASP Top 10 for LLM Applications como una de las referencias para estructurar cobertura, pero el alcance se adapta a la arquitectura real. Un sistema con RAG, agentes o tools requiere pruebas diferentes a un chatbot aislado.

LLM01:2025

Prompt Injection

Validamos si entradas directas o indirectas pueden modificar instrucciones, controles o comportamiento esperado del sistema.

LLM02:2025

Sensitive Information Disclosure

Buscamos exposición de información sensible procedente del contexto, datos, integración o comportamiento de la aplicación.

LLM05:2025

Improper Output Handling

Comprobamos si las respuestas del modelo son confiadas por otras capas sin validación suficiente y pueden provocar efectos secundarios.

LLM06:2025

Excessive Agency

Evaluamos si un agente dispone de herramientas, permisos o autonomía superiores a las necesarias para su función.

LLM07:2025

System Prompt Leakage

Analizamos exposición de instrucciones internas y, especialmente, si esas instrucciones contienen información que pueda facilitar ataques posteriores.

LLM08:2025

Vector & Embedding Weaknesses

Revisamos riesgos derivados de recuperación, segmentación, contexto compartido, documentos y mecanismos utilizados por arquitecturas RAG.

Dependiendo del sistema también se evalúan riesgos de supply chain, data/model poisoning, misinformation y unbounded consumption, además de las vulnerabilidades convencionales de aplicación, API, cloud e identidad que puedan formar parte de una cadena de ataque.

Division81 · Security Research

Cuando una conversación se convierte en un vector de ataque

En una evaluación reciente sobre una plataforma de IA generativa, nuestro equipo identificó múltiples vías de exposición que permitían reconstruir información sobre la arquitectura interna, herramientas conectadas y mecanismos operativos del sistema.

La investigación mostró por qué el riesgo no reside únicamente en el modelo: una conversación podía servir como reconocimiento, revelar el system prompt, enumerar herramientas y lógica operacional y, al continuar hacia las APIs asociadas, encontrar también una debilidad BOLA de autorización.

PROMPT INJECTION SYSTEM PROMPT TOOLS BOLA / IDOR GENAI AI RED TEAMING
Metodología ofensiva

De la arquitectura a una evidencia reproducible

Evitamos convertir el assessment en una colección indiscriminada de prompts. Las pruebas parten de la arquitectura, los activos y el impacto esperado para construir hipótesis, validar rutas y documentar riesgos que puedan reproducirse.

01

Modelado de superficie

Identificamos modelo, proveedores, RAG, APIs, tools, agentes, identidades, fuentes de datos y fronteras de confianza relevantes para el caso de uso.

02

Pruebas adversariales

Diseñamos entradas y secuencias orientadas a modificar comportamiento, extraer contexto, abusar capacidades y comprobar controles del sistema.

03

Correlación técnica

Extendemos los hallazgos hacia APIs, autorización, datos, herramientas y backend para determinar si existe una cadena de explotación real.

04

Remediación y re-test

Priorizamos controles aplicables a la causa raíz y verificamos posteriormente si la exposición fue efectivamente reducida sin romper la funcionalidad.

Cuándo evaluar

Casos donde un pentest de IA aporta información que un pentest tradicional puede no revelar

01

Chatbots con datos internos

Asistentes que consultan documentación, clientes, operaciones o información empresarial mediante RAG u otras fuentes privadas.

02

Agentes con capacidad de acción

Sistemas capaces de invocar herramientas, ejecutar funciones, crear registros, modificar datos o interactuar con procesos de negocio.

03

Copilotos y asistentes internos

Aplicaciones corporativas con acceso a repositorios, correo, CRM, código, bases documentales, tickets u otros activos empresariales.

04

Nuevos flujos o integraciones IA

Antes de producción o después de incorporar modelos, agentes, tools, RAG, proveedores externos o nuevas capacidades privilegiadas.

Evidencia para decidir

El resultado debe explicar qué ocurrió y dónde corregirlo

Los hallazgos se documentan con contexto técnico y de negocio para evitar recomendaciones genéricas como “mejorar el prompt”. La remediación debe actuar sobre la capa que realmente origina el riesgo.

Informe técnico Escenario, evidencia, pasos de reproducción, componentes afectados y causa raíz.
Mapa de cadena de ataque Relación entre interacción IA, tools, APIs, datos, identidad y posibles impactos.
Priorización ejecutiva Riesgos relevantes, exposición de negocio, controles afectados y acciones prioritarias.
Remediación y re-test Recomendaciones sobre arquitectura y controles, seguidas de validación posterior.

¿Su IA solamente conversa o también tiene acceso a su organización?

Definimos una evaluación controlada según el modelo, los datos, las herramientas, las APIs y el nivel de autonomía de su aplicación o agente.

Hablar con Grupo Oruss

Ciberseguridad Ampliada Para Todas las Cosas de la Vida