

OWASP Top 10 para Aplicaciones LLM: Guía de Seguridad en IA Generativa
Desglose completo de los diez riesgos de seguridad más críticos (LLM01 a LLM10) del OWASP Top 10 for LLM Applications 2025, con mecanismos de ataque y contramedidas prácticas.
OWASP Top 10 para Aplicaciones LLM: La Guía Definitiva de Seguridad en IA Generativa
Los modelos de lenguaje grande (LLM) dejaron de ser una curiosidad tecnológica para convertirse en infraestructura crítica. Chatbots de atención al cliente, asistentes de código, sistemas RAG que consultan documentación corporativa y agentes autónomos que ejecutan acciones reales: todos comparten una superficie de ataque nueva, distinta a la de las aplicaciones web tradicionales.
Frente a este escenario, el OWASP GenAI Security Project publicó el OWASP Top 10 for LLM Applications 2025, una taxonomía comunitaria y de código abierto que identifica y prioriza los diez riesgos de seguridad más críticos específicos de los sistemas basados en LLM. La versión 2025 refleja la evolución del panorama de amenazas, incorporando riesgos propios de la arquitectura RAG, los sistemas agénticos y los ataques sofisticados a la cadena de suministro.
En este artículo desglosamos los diez riesgos (LLM01:2025 a LLM10:2025), sus mecanismos de ataque y las contramedidas prácticas que todo equipo de arquitectura y seguridad debería aplicar.
Nota: La aplicación tradicional de pruebas de penetración web es insuficiente para los LLM. Las auditorías deben incluir fuzzing semántico, pruebas de inyección de prompts y evaluación de la cadena de suministro de datos.
LLM01:2025 — Prompt Injection (Inyección de Prompts)
Sigue siendo la vulnerabilidad más crítica. Ocurre cuando entradas maliciosas manipulan al modelo para que anule las instrucciones originales del desarrollador y ejecute comportamientos no autorizados.
- Inyección directa: el usuario introduce comandos explícitos para saltarse los controles de seguridad ("ignora las instrucciones anteriores y...").
- Inyección indirecta: el atacante oculta instrucciones en contenido externo (páginas web, correos, documentos, PDFs) que el LLM procesa, provocando acciones no deseadas sin que el usuario legítimo lo sepa.
- Inyección multimodal: riesgo emergente donde las instrucciones se incrustan en modalidades no textuales, como imágenes, para evadir la detección.
Mitigación: validación y segregación de contenido no confiable, controles de privilegios sobre las acciones del modelo, filtrado de entradas/salidas, y nunca confiar en el prompt del sistema como único mecanismo de seguridad.
LLM02:2025 — Sensitive Information Disclosure (Divulgación de Información Sensible)
Exposición involuntaria de datos privados: PII, documentos internos, credenciales, claves de API o estrategias de negocio propietarias, ya sea a través de las respuestas del modelo o de los logs del sistema.
Los LLM pueden memorizar información sensible durante el entrenamiento o filtrarla mediante interacciones directas. Este riesgo ha ganado prioridad debido a fugas de datos reales.
Mitigación: sanitización de los datos de entrenamiento, controles de acceso estrictos, evitar incrustar credenciales en los prompts del sistema, y aplicar técnicas de minimización y enmascaramiento de datos.
LLM03:2025 — Supply Chain (Cadena de Suministro)
Vulnerabilidades introducidas por componentes de terceros: modelos fundacionales, datasets, plugins, adaptadores LoRA y librerías de orquestación.
Modelos comprometidos en repositorios públicos (como Hugging Face), datos de entrenamiento envenenados y dependencias vulnerables pueden introducir backdoors o sesgos en las aplicaciones descendentes.
Mitigación: mantener un SBOM (Software Bill of Materials), verificar la procedencia de los modelos mediante firmas o comprobación de hashes, y monitorizar continuamente las dependencias en busca de vulnerabilidades conocidas.
LLM04:2025 — Data and Model Poisoning (Envenenamiento de Datos y Modelos)
Manipulación de los datos de entrenamiento, fine-tuning o embeddings para inyectar backdoors, introducir sesgos o degradar el rendimiento del modelo.
Un atacante que contamina el conjunto de datos puede provocar que el modelo se comporte de forma maliciosa ante desencadenantes específicos, manteniéndose "limpio" en condiciones normales.
Mitigación: verificar la integridad y procedencia de los datos, aplicar controles de versión sobre datasets, usar validación estadística de anomalías y entornos de entrenamiento aislados.
LLM05:2025 — Improper Output Handling (Manejo Inadecuado de la Salida)
Ocurre cuando los sistemas descendentes confían en el contenido generado por el modelo (código, SQL, HTML, comandos) sin validación adecuada, habilitando ataques de inyección como XSS, CSRF, SSRF o incluso ejecución remota de código (RCE).
El LLM se convierte en un vector: su salida se ejecuta o renderiza sin control.
Mitigación: tratar toda salida del modelo como entrada no confiable, aplicar codificación contextual, validación estricta, sandboxing y el principio de mínimo privilegio en los sistemas que consumen las respuestas.
LLM06:2025 — Excessive Agency (Agencia Excesiva)
Conceder a los agentes LLM permisos, autonomía o alcance excesivos sobre herramientas y funciones, permitiéndoles ejecutar acciones dañinas más allá de su propósito previsto.
Con la explosión de los sistemas agénticos, este riesgo es cada vez más relevante: un agente con demasiada "funcionalidad", "permisos" o "autonomía" puede borrar registros, enviar correos o realizar transacciones no autorizadas.
Mitigación: limitar las funciones y extensiones disponibles, aplicar mínimo privilegio, exigir aprobación humana (human-in-the-loop) para acciones de alto impacto y registrar/auditar todas las acciones del agente.
LLM07:2025 — System Prompt Leakage (Fuga del Prompt del Sistema)
Riesgo formalizado en 2025. Consiste en la extracción de las instrucciones internas, lógica operativa y guardarraíles de seguridad del sistema.
Los atacantes usan los prompts del sistema filtrados para comprender la arquitectura del modelo, identificar cómo saltarse los filtros de contenido o robar datos de configuración interna.
Mitigación: el prompt del sistema nunca debe tratarse como secreto ni usarse como control de seguridad. La lógica crítica de autorización y privilegios debe residir en sistemas deterministas externos al LLM.
LLM08:2025 — Vector and Embedding Weaknesses (Debilidades de Vectores y Embeddings)
Dirigido a arquitecturas RAG (Retrieval-Augmented Generation). Aborda la seguridad de las bases de datos vectoriales.
- Inversión de embeddings: reconstruir el texto original a partir de los vectores.
- Envenenamiento del vector store: inyectar contenido malicioso en la base de conocimiento.
- Controles de acceso débiles: recuperar información no autorizada por multi-tenancy mal segmentado.
Mitigación: controles de acceso de grano fino sobre los vector stores, segmentación por tenant, validación de integridad de la base de conocimiento y cifrado de los embeddings.
LLM09:2025 — Misinformation (Desinformación)
Generación de contenido factualmente incorrecto o fabricado (alucinaciones) que los usuarios o los sistemas descendentes sobre-confían, llevando a decisiones erróneas.
El riesgo no es solo técnico: cuando un LLM afirma con seguridad datos falsos —referencias legales inexistentes, dosis médicas incorrectas o código inseguro— el impacto puede ser legal, financiero o de reputación.
Mitigación: grounding con fuentes verificadas (RAG bien diseñado), verificación cruzada automática, comunicar la incertidumbre al usuario y mantener supervisión humana en dominios críticos.
LLM10:2025 — Unbounded Consumption (Consumo Ilimitado)
Uso descontrolado de recursos (cómputo, tokens o coste) por parte de la aplicación LLM, que puede derivar en denegación de servicio (DoS) o en pérdidas económicas significativas (Denial of Wallet, DoW).
Consultas deliberadamente costosas, bucles de agentes o entradas masivas pueden disparar la factura de inferencia o agotar la capacidad del servicio.
Mitigación: límites de tasa (rate limiting), cuotas por usuario, límites de longitud de entrada y salida, presupuestos de tokens, monitorización de costes en tiempo real y alertas de consumo anómalo.
Resumen: los diez riesgos de un vistazo
| ID | Riesgo | Foco principal |
|---|---|---|
| LLM01 | Prompt Injection | Manipulación de entradas y anulación de instrucciones |
| LLM02 | Sensitive Information Disclosure | Fugas de PII, credenciales y datos propietarios |
| LLM03 | Supply Chain | Integridad de modelos/datasets de terceros |
| LLM04 | Data and Model Poisoning | Datos de entrenamiento/embeddings contaminados |
| LLM05 | Improper Output Handling | Inyección de código/SQL desde la salida del LLM |
| LLM06 | Excessive Agency | Function calling y autonomía con exceso de privilegios |
| LLM07 | System Prompt Leakage | Exposición de la lógica operativa interna |
| LLM08 | Vector/Embedding Weaknesses | Vulnerabilidades RAG de recuperación y almacenamiento |
| LLM09 | Misinformation | Alucinaciones y hechos fabricados |
| LLM10 | Unbounded Consumption | Agotamiento de recursos y ataques DoS/DoW |
Cómo operacionalizar el OWASP Top 10 para LLM
El OWASP Top 10 para LLM está diseñado para complementar, no reemplazar, los marcos de seguridad establecidos:
- Seguridad por capas: integra estos riesgos en marcos de gestión más amplios como NIST AI RMF o ISO/IEC 42001.
- Vocabulario compartido: usa estas categorías como lenguaje común para documentar el riesgo residual, definir suites de pruebas y guiar las revisiones de arquitectura.
- Metodología de auditoría: incorpora fuzzing semántico, pruebas de inyección de prompts y red teaming específico de IA a tu ciclo de desarrollo.
Conclusión
Adoptar LLM sin un modelo de amenazas específico es asumir un riesgo silencioso. El OWASP Top 10 for LLM Applications 2025 ofrece un punto de partida riguroso y accionable para diseñar, auditar y gobernar sistemas de IA generativa de forma responsable.
En Jovalro Tech recomendamos tratar estos diez riesgos no como una checklist puntual, sino como un ciclo continuo de gobernanza —integrado con TOGAF, NIST AI RMF e ISO/IEC 42001— que evoluciona al mismo ritmo que la tecnología que protege.


