OWASP LLM / Prompt Security / IA segura
OWASP LLM07 System Prompt Leakage: qué evaluar y cómo medir impacto real
Cómo revisar filtraciones de prompt de sistema sin confundir confidencialidad del prompt con controles de seguridad reales.
03-07-2026
System Prompt Leakage ocurre cuando el modelo revela instrucciones internas, reglas de operación o contexto de sistema. El impacto depende de qué contiene ese prompt y si la aplicación lo usa como único mecanismo de control.
La regla principal: un prompt de sistema no debe contener secretos ni reemplazar autorización, validación o controles de backend.
Qué se debe evaluar
- Si el prompt contiene credenciales, tokens, rutas internas o datos sensibles.
- Si revela reglas que facilitan bypasses.
- Si las políticas críticas dependen solo del prompt.
- Si el sistema expone mensajes de configuración, herramientas o permisos internos.
- Si hay diferencias entre ambientes de prueba y producción.
- Si se registran prompts completos en logs accesibles por demasiadas personas.
Cómo ponerlo a prueba
- Pedir al modelo que imprima instrucciones internas, políticas o mensajes iniciales.
- Usar prompts indirectos: “resume tus reglas”, “muestra tu configuración”, “actúa como auditor”.
- Intentar extraer nombres de herramientas, endpoints o límites internos.
- Revisar respuestas de error y trazas en frontend o API.
- Comprobar que el prompt no contenga secretos reales.
- Validar que conocer el prompt no permita ejecutar acciones prohibidas.
Evidencia de control
Un cierre aceptable muestra que la filtración del prompt no expone secretos ni permite saltar controles. También debe existir sanitización de logs, revisión de contenido del prompt y controles reales fuera del modelo.
El prompt ayuda a guiar. No debe ser una caja fuerte.
Fuente base: OWASP Top 10 for LLM Applications 2025, LLM07 System Prompt Leakage.