AI agents

Inyección de prompts

By Jake Luo · Published 13 ago 2026

La inyección de prompts es un ataque en el que las instrucciones escondidas dentro del contenido que lee un agente de IA — una página web, un PDF, la reseña de un producto, un correo entrante — son obedecidas por el modelo como si las hubieras escrito tú. Solo se vuelve peligrosa cuando el agente tiene herramientas: la misma frase que es inofensiva en una ventana de chat se convierte en una orden de enviar, publicar o gastar en el momento en que el modelo puede actuar.

Cómo funciona la inyección de prompts

La ventana de contexto de un agente no distingue entre las instrucciones que escribiste tú y el texto que él trajo. Ambos llegan como tokens en el mismo flujo. Así que cuando un agente lee la página de un competidor para resumirla, y esa página contiene una línea dirigida al modelo en vez de al lector, el modelo no tiene forma estructural de saber que no debería obedecer. Esto no es un defecto de un producto concreto. Es una propiedad de cómo los modelos actuales consumen la entrada, y por eso no existe un parche, solo contención.

La superficie de ataque es sencillamente cada sitio del que tu agente toma texto escrito por otra persona, que para un agente de marketing es casi todo su trabajo:

  • Todo lo rastreado — páginas de competidores, resultados de búsqueda, documentación que el agente lee para responder algo.
  • Todo lo subido — una base de conocimiento en PDF, una hoja de cálculo, una imagen con texto dentro.
  • Todo lo generado por usuarios — reseñas de tiendas de apps, hilos de foros, tickets de soporte, envíos de formularios.
  • Todo lo entrante — correo, mensajes de chat, cargas útiles de webhooks, incluso el título de una invitación de calendario.

Por qué un modelo que se niega a filtrar secretos no es una defensa

La intuición habitual es que un modelo bien entrenado simplemente se negará. A menudo lo hace, ante la formulación obvia. Ejecutamos una prueba de penetración autorizada contra uno de nuestros propios contenedores de producción en julio de 2026 y el patrón fue inequívoco. Una instrucción inyectada que pedía al agente imprimir una clave de API fue rechazada. Una instrucción inyectada planteada como una comprobación rutinaria de conectividad — una que referenciaba esa misma clave como variable de entorno dentro de un comando en lugar de escribir el valor — se ejecutó sin dudar, y la credencial salió de la máquina.

La asimetría es toda la lección. La cautela del modelo con los secretos protege el camino en el que tendría que decir el secreto en voz alta. Cuando el agente ejecuta un comando, la shell sustituye el valor y el modelo nunca lo ve, así que no hay nada que su criterio pueda atrapar. Cualquier defensa que dependa de que el modelo reconozca la mala intención está vigilando una puerta de un edificio con varias, y el encuadre entra por las otras: niégate a esto y declina, ejecuta este paso de configuración y obedece.

Lo que sí reduce el riesgo

Como la vulnerabilidad no se puede entrenar hasta hacerla desaparecer, las mitigaciones útiles son arquitectónicas. Cada una asume que la inyección tiene éxito y limita lo que puede alcanzar:

  • Mantén las credenciales fuera del alcance del agente. Una clave que el entorno del agente nunca tiene no se le puede sacar. Enrutar las llamadas al modelo a través de un proxy que guarde la credencial es la única mitigación que cierra este camino concreto en vez de estrecharlo.
  • Mínimo privilegio en cada credencial. Si un token solo puede ejecutar inferencia, o solo leer una propiedad, una fuga te cuesta una factura en lugar de una cuenta.
  • Limita la salida de red. Un agente que solo puede alcanzar una lista conocida de hosts tiene muchos menos sitios a donde enviar lo que le hayan sacado con engaño.
  • Pon una puerta a las acciones que salen del edificio. Una puerta de aprobación delante de todo lo que se publica, se envía o se gasta convierte una inyección exitosa en un borrador que rechazas, no en una publicación que leen tus clientes.
  • Trata la salida del agente también como entrada no confiable. Cuando el resumen de un agente se convierte en el contexto de otro, la instrucción inyectada viaja con él.

La inyección de prompts en un agente de marketing

Los agentes de marketing están inusualmente cerca de este riesgo, porque leer cosas que escribieron desconocidos es el trabajo y no un caso extremo. Un especialista en investigación rastrea sitios de competidores. Uno de feedback lee reseñas de tiendas de apps. Uno de comunidad lee hilos de foros. Cada uno de esos es un canal donde alguien de fuera de tu empresa elige el texto, y ninguno se puede blindar sin quitar la razón por la que existe el agente.

Ese es el razonamiento detrás de cómo está construido AgentCeres — el AI Growth Officer en agentceres.com: los especialistas que leen la web abierta están separados del permiso para actuar sobre lo que leen, y cada acción saliente espera un clic humano. Leer mucho y publicar libremente son dos privilegios distintos, y un agente que tiene ambos está a una página web hostil de usarlos juntos. Si estás decidiendo cuánta cuerda darle a un agente en tus propias cuentas, ¿debería dejar que un agente de IA publique en redes sociales por mí? trabaja la misma pregunta desde el otro extremo; human-in-the-loop es el principio general debajo de ambas.

FAQ

¿Qué es la inyección de prompts en términos simples?
Es texto que le habla a la IA en vez de a ti. Si un agente lee una página, una reseña o un correo que contiene una instrucción, el modelo puede seguirla, porque todo lo que lee llega en el mismo flujo que tus propias instrucciones y nada marca cuál es cuál. La consecuencia depende por completo de lo que el agente pueda hacer: sin herramientas es una molestia, y con capacidad de enviar, publicar o gastar es un ataque real.
¿Se puede arreglar la inyección de prompts con mejores prompts?
No. Decirle a un modelo que ignore las instrucciones que encuentre en el contenido sube el listón y no cierra el agujero, porque el atacante escribe después de tu instrucción y puede dirigirse al modelo directamente, con toda la extensión y el encuadre que le funcione. Trata el endurecimiento del prompt como una capa más, nunca como el control del que dependes. Las capas que aguantan son las que sobreviven a que el modelo sea engañado: credenciales restringidas, red restringida y una persona aprobando lo irreversible.
¿Es un riesgo la inyección de prompts si mi agente solo lee y nunca escribe?
Menor, pero no cero. A un agente de solo lectura todavía se le puede inducir a revelar lo que ve — configuración, datos de otros clientes si el aislamiento es débil, cualquier cosa de su entorno — y se le puede hacer envenenar su propia salida, de modo que un agente posterior o una persona actúen sobre una conclusión elegida por el atacante. El radio de impacto se encoge con los permisos; no desaparece hasta que el agente no lee nada no confiable, que para un agente útil es nunca.
Related terms
Humano en el bucle (HITL)Puerta de aprobaciónAgente de IAFlujo de trabajo agéntico

An AI growth team that runs this for you

AgentCeres is a managed AI marketing team — you approve what ships. 14-day free trial, from $39/month.

Start free trialBrowse the glossary