Resumen ejecutivo

El 67% de las organizaciones latinoamericanas aceleró su uso de IA en los últimos dos años, pero el 42% no confía en la preparación de su país ante grandes incidentes cibernéticos. Esa brecha es el territorio de esta charla. César Orellana, SOC Manager, recorre la superficie de ataque completa de los modelos de lenguaje: desde la inyección de prompts —directa, indirecta y por jailbreak— hasta la exfiltración de datos y la ejecución remota de código cuando el modelo está conectado a herramientas. Con casos reales fechados, desde Bing Chat revelando sus instrucciones internas en 2023 hasta el secuestro de cuentas de Instagram vía el asistente de Meta AI en 2026, y un dato que debería inquietar a cualquiera que autoaloje modelos: más de 175.000 hosts de Ollama expuestos públicamente. La conclusión no es dejar de usar IA: es entender por qué esto es difícil de prevenir y aplicar los controles que sí funcionan.

1. El contexto regional

67%

de las organizaciones latinoamericanas aceleró su uso de IA en 24 meses

78%

del uso regional corresponde a herramientas generativas

42%

no confía en la preparación de su país ante grandes incidentes

Fuentes citadas en la charla: IBM Global AI Adoption Index 2023; CEPAL, Observatorio de Desarrollo Digital 2025; World Economic Forum, Global Cybersecurity Outlook 2025.

Antes de atacar hay que entender qué se ataca, y la charla distingue tres cosas que suelen confundirse. Una aplicación LLM genera respuestas a partir de una instrucción; está limitada al conocimiento del modelo y al contexto entregado. Un sistema RAG busca información en documentos y bases de datos propias: gana precisión y actualidad, pero depende de la calidad de esos datos. Y un agente analiza la tarea, planifica los pasos y toma acciones conectándose a APIs y sistemas — automatiza procesos, pero por eso mismo requiere permisos y controles de seguridad. Cada escalón agrega capacidad y, con ella, superficie de ataque.

2. Inyección de prompts: la vulnerabilidad número uno

La definición es simple: una técnica para manipular o engañar a un modelo a través de su entrada. La analogía que usa Orellana es la más clara posible: es como una inyección SQL, pero en lenguaje natural. El objetivo, hacer que el modelo revele o ejecute algo que no debería. Desde 2025 es el riesgo LLM01 del OWASP Top 10 para aplicaciones con modelos de lenguaje — es decir, el primero de la lista.

Hay tres variantes y no se defienden igual:

EjeInyección directaInyección indirectaJailbreak
OrigenUsuario directoFuentes externas, RAG, memoriaUsuario con tácticas creativas
Forma típicaInstrucciones explícitasInstrucciones embebidas en contenidoPrompts encadenados o disimulados
DetecciónRelativamente fácil (patrones)Difícil: parece contenido legítimoVariable, requiere red teaming
MitigaciónFiltrado + protección del system promptSanitización de fuentes + metadatos de confianzaEntrenamiento adversario + filtros de salida

La indirecta es la que debería quitar el sueño. Las instrucciones no las escribe el usuario: van escondidas en una página web, un comentario, los metadatos o el nombre de un archivo, o incluso dentro de una imagen como texto no visible. El flujo es siempre el mismo: el atacante inserta la instrucción oculta → el usuario le pide a la IA que procese ese contenido ("resume esta página") → la IA lo lee todo como instrucciones válidas → actúa. Y "actuar", en un navegador con IA agéntica, puede significar acceder a correos, extraer datos y enviárselos al atacante — sin que el usuario note nada. La charla muestra el caso documentado en el navegador Comet de Perplexity.

Conviene no confundirla con el jailbreak, que es su primo cercano pero distinto: la inyección sobrescribe las instrucciones del sistema para que la IA ejecute acciones no previstas; el jailbreak construye prompts que evaden las medidas de seguridad para obtener salidas restringidas.

3. Cuando el modelo tiene manos: exfiltración y RCE

Todo lo anterior sube de categoría cuando el modelo está conectado a herramientas. Vía function calling, una inyección puede derivar en una inyección SQL ejecutada por el propio agente contra la base de datos que tiene autorizada. Y en el peor escenario, en ejecución remota de código: entrada maliciosa → el modelo la interpreta como instrucción válida → genera código o comandos → el sistema los ejecuta automáticamente. Impacto: control del servidor, exfiltración de información y compromiso total del entorno.

No es teórico. La charla cita CVE-2023-29374, en LangChain: el framework incluía herramientas como un REPL de Python y ejecución de shell, de modo que un agente que recibiera una entrada maliciosa podía generar código y ejecutarlo directamente. ¿Qué puede filtrarse por estas vías? Secretos del sistema, instrucciones internas de seguridad, código de aplicaciones y datos sensibles de entrenamiento como tokens de acceso y correos.

4. Cinco años de casos reales

La parte más contundente de la charla es la cronología de incidentes públicos, que muestra cómo el problema escaló de curiosidad a riesgo operacional:

  • Feb 2023 · Bing Chat. Atacantes lo engañaron para que revelara sus instrucciones de sistema ocultas, exponiendo directrices internas confidenciales.
  • Mar 2023 · ChatGPT web. Un prompt oculto embebido en texto copiado permitía extraer el historial de chat y datos sensibles cuando el usuario lo pegaba.
  • Jun 2023 · Auto-GPT. Una inyección indirecta manipuló al agente hasta lograr ejecución de código.
  • Jul 2023 · Jailbreaks universales. Investigadores publicaron prompts que evadían las restricciones de varios modelos a la vez.
  • Sep 2024 · Envenenamiento de memoria en ChatGPT. Una inyección persistente manipuló la función de memoria para robar datos de todas las conversaciones nuevas y enviarlos a un servidor remoto.
  • Ago 2025 y jul 2026 · Exposición por indexación. Conversaciones compartidas quedaron visibles en buscadores, primero en ChatGPT y luego en Claude.
  • Mar 2026 · Phishing servido por IA. La respuesta generada por la IA de Google mostró como sitio oficial una página fraudulenta que suplantaba a Clave Única, diseñada para capturar el RUN y la contraseña de usuarios chilenos.
  • Jun 2026 · Secuestro de cuentas en Instagram. Una inyección en el asistente de recuperación de Meta AI permitió manipular flujos de soporte con privilegios elevados, eludiendo 2FA y facilitando el secuestro de cuentas de alto valor.

A eso se suma el Shadow AI: el uso de herramientas de inteligencia artificial dentro de una organización sin autorización, control ni visibilidad del área de TI. Es el equivalente moderno del Shadow IT, con la diferencia de que aquí los datos que se van no vuelven.

5. La infraestructura expuesta: 175.000 hosts de Ollama

El hallazgo con el que Orellana cierra la parte técnica es el que más debería mover la aguja en la región, donde autoalojar modelos se volvió práctica común para ahorrar costos. Escaneando internet aparecen más de 175.000 hosts de Ollama identificados públicamente. La exposición dejó de ser un problema aislado: los LLM autoalojados están formando una nueva superficie pública de infraestructura.

El riesgo tiene dos capas. La primera, evidente: una API expuesta permite uso no autorizado del modelo y consumo de tus recursos. La segunda, más grave: las capacidades de tool calling amplifican el impacto al conectar ese modelo abierto con código, archivos, APIs y otros sistemas de tu red. La recomendación es la de siempre, pero aplicada a un componente que muchos todavía no tratan como infraestructura crítica: autenticación, aislamiento de red, monitoreo y mínimo privilegio.

AñoHito
2023Investigación HouYi: 31 de 36 aplicaciones evaluadas resultaron vulnerables a inyección de prompts.
2024«Probllama»: RCE crítica descubierta en Ollama (Wiz Research).
2025La inyección de prompts se consolida como OWASP LLM01, el riesgo principal.
2026Exposición masiva: más de 175.000 hosts Ollama identificados.

6. Por qué es tan difícil de prevenir

Tres razones estructurales, y ninguna se arregla comprando una herramienta. Confusión de contexto: el modelo no distingue bien entre instrucciones y contenido — para él, todo es texto. Ambigüedad del lenguaje: el lenguaje natural es intrínsecamente ambiguo, y las defensas basadas en detectar "frases maliciosas" siempre van un paso atrás de la creatividad humana. Defensas imperfectas: los controles de seguridad existentes no son infalibles, y tratarlos como si lo fueran es el error más caro.

De ahí que la mitigación no sea un filtro, sino una lista de verificación en capas, alineada con el OWASP Top 10 para LLM: inyección de prompts controlada · información sensible protegida · cadena de suministro verificada · datos y modelos protegidos · salidas validadas y sanitizadas · permisos y autonomía limitados · prompt del sistema protegido · vectores y embeddings asegurados · respuestas verificadas y confiables · consumo de recursos controlado.

7. Conclusiones

Tres ideas para llevarse. Primero, la inyección de prompts no es un bug que se parchea: es una consecuencia de cómo funcionan los modelos, y por eso la defensa vive en la arquitectura que los rodea, no dentro del modelo. Segundo, el salto de riesgo ocurre cuando el modelo pasa de responder a actuar: la misma inyección que ayer revelaba un system prompt hoy secuestra una cuenta o ejecuta código, porque le dimos herramientas. Tercero, si autoalojas, eres infraestructura: 175.000 hosts expuestos demuestran que la comodidad de levantar un modelo local se está pagando en superficie de ataque.

La lectura regional es directa: LATAM adoptó IA generativa más rápido de lo que profesionalizó su seguridad. Cerrar esa brecha no requiere presupuestos enormes — requiere tratar al modelo como lo que es: un componente más de la arquitectura, con autenticación, permisos mínimos, monitoreo y validación de salidas.

Referencias

  • Orellana, C. (2026). Seguridad en modelos de IA y LLMs [presentación]. I Congreso IA-LATAM. PDF de la charla.
  • Orellana, C. (2026). Seguridad en IA y LLMs: Prompt Injection, RCE y fuga de datos [video]. Canal de Comunidad IA LATAM en YouTube. youtube.com/watch?v=I9hr-ft_QfY.
  • OWASP GenAI Security Project — Top 10 para aplicaciones con modelos de lenguaje (LLM01: Prompt Injection).
  • CVE-2023-29374 — ejecución de código en LangChain. NVD.
  • Estadísticas regionales: IBM Global AI Adoption Index 2023 · CEPAL, Observatorio de Desarrollo Digital 2025 · World Economic Forum, Global Cybersecurity Outlook 2025.
  • Investigaciones citadas sobre exposición y vulnerabilidades: HouYi · Wiz Research («Probllama») · SentinelLABS y Censys.

Sobre el autor

César Orellana es ingeniero informático y especialista en ciberseguridad, SOC Manager en GlobalCatalog (Chile). Tiene experiencia en operaciones de centro de seguridad, pentesting y respuesta ante incidentes, y lidera proyectos de monitoreo, automatización e inteligencia artificial aplicada a la seguridad, combinando gestión estratégica con trabajo técnico en soluciones SIEM y XDR. LinkedIn · cesarorellana.cl

Artículo elaborado por la Comunidad IA LATAM a partir de la presentación oficial y la transcripción del video de la charla. Todos los casos citados son incidentes públicos ya divulgados y corregidos por sus responsables. Este contenido se comparte con fines educativos y de seguridad defensiva.