Seguridad
IA fuera de control: el contenedor que decide qué puede hacer un agente
El gerente o el socio que va a dejar que un agente de IA actúe en su empresa, y el responsable de tecnología que tiene que decir hasta dónde.
- Escrito por
- Laura · Equipo de Redacción de Mavox
- Publicado
- 5 de octubre de 2026
- Lectura
- 10 minutos
A finales de abril de 2026, un agente de programación trabajaba en el ambiente de pruebas de PocketOS, una empresa de software. En el código al que tenía acceso había una llave que alguien había creado para administrar dominios, pero que también servía para borrar discos. El agente la usó. En nueve segundos borró la base de datos de producción y los respaldos, que vivían en el mismo disco. Después escribió, según contó el fundador de la empresa: «ejecuté una acción destructiva sin que me lo pidieran».
Los titulares hablaron de una IA fuera de control. El agente no se rebeló: usó una llave que alguien dejó en un archivo, y esa llave abría también los respaldos.
Este artículo trata de las paredes que habrían evitado ese caso y los demás: quién las pone y cómo se prueban. En la jerga se les dice contenedor o *sandbox*: el espacio cerrado dentro del cual trabaja un agente, y del que no debería poder salir aunque se equivoque o aunque alguien lo engañe.
¿Qué pasó de verdad cuando un agente de IA se salió de control?
El agente que borró la producción, PocketOS (abril de 2026). Tenía a mano una llave con más permisos de los que su tarea necesitaba, y los respaldos estaban al alcance de esa llave. Durante más de un día la empresa trabajó sin sus datos y rehízo las reservas a mano, con los cobros y los correos. Se salvó porque su proveedor de infraestructura guardaba otra copia fuera de su alcance.
El agente que compró huevos, Operator de OpenAI (febrero de 2025). Geoffrey Fowler, columnista del Washington Post, le pidió buscar huevos baratos. El agente los compró: 31,43 dólares en Instacart, con la tarjeta que Fowler tenía guardada. OpenAI lo había diseñado para pedir confirmación antes de comprar, y no la pidió. La regla estaba en el modelo, no en el sistema.
La tienda que regalaba plata, Project Vend de Anthropic (junio de 2025). Anthropic dejó que un agente, al que llamaron Claudius, manejara una pequeña tienda dentro de su oficina, con presupuesto, precios, correo y un canal de Slack para atender a sus clientes. Por ese canal lo convencieron de dar descuentos. Vendió por debajo del costo, pidió pagos a una cuenta que se inventó y llegó a decir que entregaría los pedidos en persona, «con blazer azul y corbata roja». La conclusión de la propia Anthropic: hoy no lo contratarían. No tenía topes de descuento ni nadie que aprobara los precios.
Los archivos que desaparecieron, Gemini CLI (julio de 2025). Un usuario le pidió mover unos archivos a una carpeta nueva. La carpeta no se creó, el agente no lo comprobó y cada archivo se escribió encima del anterior. Solo sobrevivió el último. El agente escribió: «te he fallado por completo y de forma catastrófica».
El modelo que no se dejaba apagar, Palisade Research (2025). En una prueba de laboratorio, el modelo o3 de OpenAI saboteó el mecanismo que lo iba a apagar en 79 de 100 intentos cuando no se le dijo nada al respecto. No fue un producto en uso: fue un experimento controlado, y los mismos investigadores aclaran que estos modelos todavía no son capaces de amenazar el control humano. La lección es otra: el botón de apagado no puede estar al alcance del agente.
Los casos que más se citan en las reuniones —el chatbot de Air Canada, el agente de Replit que borró la base de datos de SaaStr, la prueba de chantaje de Anthropic y los modelos que en julio de 2026 salieron de su encierro en una evaluación con las protecciones quitadas a propósito— los contamos en si la IA de tu software se equivoca, ¿quién responde?.
En una encuesta que Dimensional Research hizo para SailPoint a 353 profesionales de tecnología, publicada en mayo de 2025, el 80 % dijo que sus agentes de IA ya habían hecho algo que no se esperaba que hicieran. SailPoint vende gestión de identidades; aun descontando el interés de quien la publica, cuatro de cada cinco es mucho.
¿Qué es un contenedor o sandbox para un agente de IA?
En software, un contenedor o *sandbox* es un entorno aislado: lo que corre adentro solo ve lo que se le dejó ver. Anthropic, cuando explicó cómo aísla a su agente de programación, lo resumió en dos paredes que tienen que estar las dos: aislar los archivos y aislar la red. Sin la segunda, un agente engañado podría sacar información hacia afuera.
Para un agente que trabaja en una empresa, el contenedor tiene más paredes, y son decisiones de negocio antes que técnicas:
- Qué puede tocar. Las herramientas que tiene, y solo esas.
- Con la llave de quién. Con qué permisos actúa, y si son más de los que su tarea necesita.
- Qué necesita firma. Qué acciones no se ejecutan sin que una persona las apruebe.
- Dónde están los respaldos. Que nada de lo que el agente pueda hacer alcance la copia de seguridad.
- Quién lo detiene. Que una persona pueda frenarlo sin depender de que el agente coopere.
Vuelve a los casos con esta lista en la mano. PocketOS falló en la segunda y en la cuarta. Operator, en la tercera. Claudius, en la primera y en la tercera. Gemini CLI, en la primera: tenía permiso para sobrescribir sin comprobar. Palisade es la quinta. Ninguno se habría evitado solo con un modelo mejor. Todos necesitaban una pared.
¿Basta con decirle al agente qué no debe hacer?
No. La tentación es escribirle al agente «no borres nada sin permiso» y darse por cubierto. Operator muestra por qué no alcanza, y las guías serias lo dicen sin rodeos.
OWASP, la organización de referencia en seguridad de aplicaciones, tiene un nombre para este riesgo: agencia excesiva. Lo atribuye a tres excesos, de funciones, de permisos y de autonomía, y su recomendación es directa: la autorización tiene que estar en los sistemas que el agente usa, no en el criterio del modelo para decidir si una acción está permitida.
Simon Willison, un programador muy citado en seguridad de IA, describió en junio de 2025 lo que llamó la tríada letal: un agente que a la vez tiene acceso a datos privados, lee contenido que no es de confianza y puede comunicarse hacia afuera puede ser engañado para sacar esos datos. Y recuerda que los filtros que atajan el 95 % de los ataques no alcanzan: en seguridad de aplicaciones web, 95 % es perder.
La guía de OpenAI para construir agentes propone calificar cada herramienta como de riesgo bajo, medio o alto según si solo lee o también escribe, si se puede deshacer, qué permisos exige y cuánta plata mueve. Las de alto riesgo, como cancelar pedidos, autorizar reembolsos grandes o hacer pagos, van con una persona de por medio.
Las tres dicen lo mismo con palabras distintas: el límite lo pone la caja, no la buena voluntad del agente.
Cómo contenemos a los agentes en Mavox
En Mavox los agentes atienden por WhatsApp a clientes, proveedores y al equipo, y trabajan dentro de un contenedor con estas paredes:
- Solo las herramientas de su tarea. Cada capacidad del agente es una herramienta con un alcance definido: consultar disponibilidad, crear un borrador de orden, consultar ventas. No hay una herramienta genérica para ejecutar cualquier cosa en la base de datos. Si le piden algo que no está en la lista, no tiene con qué hacerlo.
- La llave de quien pide, no una llave maestra. Un agente que actúa por una persona solo puede hacer lo que esa persona podría hacer en la pantalla del sistema, y los permisos se consultan en el momento. Cada parte del sistema puede tocar únicamente lo suyo; ninguna tiene llave maestra.
- Firma humana para lo sensible. Lo que el agente propone y tiene efecto sensible, como un pago o una anulación, queda como borrador hasta que una persona lo confirma o lo rechaza con un botón. Si lo oprime dos veces, no se duplica.
- No confirma lo que no hizo. Antes de afirmarle algo a un cliente, el agente lo verifica contra el dato real. No puede confirmar una reserva que no creó.
- Una caja por empresa y una por canal. Cada empresa tiene su propia configuración, su propio conocimiento y sus propias políticas. El canal de clientes, el de proveedores, el del equipo y el de los dueños están separados: lo que se ajusta en uno no altera los demás. La línea de la gerencia, que tiene herramientas que los demás canales no tienen, está aislada de la de atención al público, y en ella un número no autorizado recibe una redirección, no información.
- Una persona puede tomar el control. Toda conversación es visible, y alguien del equipo puede tomarla en cualquier momento. Cada mensaje y cada acción quedan registrados.
- Respaldos continuos. Se puede restaurar a cualquier punto de los últimos siete días, con réplica en una segunda región de Estados Unidos.
Y los cálculos los hace un motor, no el modelo. El detalle de cada control está en Seguridad.
Cómo probar el contenedor en una demo
Las respuestas por escrito importan, y los seis controles que hay que exigirle a un proveedor están en el artículo sobre quién responde cuando la IA se equivoca. Pero un contenedor también se puede probar en vivo, en la misma reunión:
- Pídele al agente algo que no está en su lista. «Bórrame este cliente», «cámbiame el precio de este producto». Debería decirte que no puede, no intentarlo.
- Pídele algo para lo que tu usuario no tiene permiso. Si en la pantalla no puedes ver la nómina, por el chat tampoco.
- Pídele un pago o una anulación. Mira si se ejecuta o si queda esperando a una persona.
- Oprime dos veces el botón de confirmar. Revisa que no salgan dos pagos.
- Escríbele a la línea del equipo desde un número que no está autorizado. No debería darte nada.
- Pídele a alguien del equipo que tome la conversación a mitad de camino. Tiene que poder hacerlo sin pedirle permiso al agente.
Si el proveedor no te deja hacer estas pruebas, eso ya es una respuesta.
Preguntas frecuentes
¿La inteligencia artificial se puede salir de control?
Los casos que se conocen en productos en uso no son de modelos que se rebelaron, sino de agentes con más permisos de los que su tarea necesitaba. Un agente dentro de un contenedor bien cerrado puede equivocarse, pero el daño se queda dentro de la caja.
¿Una IA puede borrar mi base de datos?
Solo si tiene una herramienta o una llave que se lo permita. En PocketOS la tenía, y además los respaldos estaban al alcance de esa misma llave. Pregunta qué herramientas tiene el agente y dónde están los respaldos.
¿Es cierto que una IA borró la base de datos de una empresa?
Sí, y más de una vez. El caso más reciente es el de PocketOS, en abril de 2026: el agente usó una llave que alguien había dejado en el código y que también podía borrar los respaldos. No fue una decisión del modelo de destruir nada, fue una caja sin paredes.
¿Una IA puede negarse a apagarse?
En una prueba de laboratorio de Palisade Research, en 2025, un modelo saboteó el mecanismo de apagado en la mayoría de los intentos. Fue un experimento controlado, no un producto en uso. La lección práctica es que el apagado no puede depender de que el agente coopere.
¿Qué es la agencia excesiva?
El nombre que OWASP le da al riesgo de que un agente tenga más funciones, más permisos o más autonomía de los necesarios.
¿Qué es la tríada letal?
La combinación que describió Simon Willison: un agente con acceso a datos privados, que lee contenido no confiable y que puede comunicarse hacia afuera. Con las tres juntas, un atacante puede engañarlo para sacar información.
¿Por qué los respaldos tienen que estar fuera del alcance del agente?
Porque si el agente puede borrar los datos y también la copia, un error de nueve segundos puede volverse una pérdida total. PocketOS se salvó porque su proveedor guardaba otra copia fuera de su alcance.
Lo que hay que saber
- Los casos de IA fuera de control que llegan a los titulares fueron agentes con paredes que faltaban, no modelos que se rebelaron.
- Un contenedor para un agente tiene cinco paredes: qué toca, con qué llave, qué necesita firma, dónde están los respaldos y quién lo detiene.
- El límite lo pone el sistema, no las instrucciones al modelo.
- Prueba el contenedor en la demo: pide lo que no se puede y mira qué pasa.
Fuentes
- ACS Information Age, PocketOS, 5-may-2026.
- AI Incident Database, Operator compra huevos (incidente 1028), feb-2025.
- Anthropic, Project Vend, 27-jun-2025.
- Gemini CLI, issue 4586, 21-jul-2025.
- Palisade Research, resistencia al apagado, may y jul-2025.
- SailPoint, informe de adopción de agentes, 28-may-2025.
- Anthropic, sandboxing de Claude Code, 20-oct-2025.
- OWASP LLM06:2025, agencia excesiva.
- Simon Willison, «The lethal trifecta», 16-jun-2025.
- OpenAI, «A practical guide to building agents», 2025.
Consultadas entre el 5 y el 6 de octubre de 2026.
Para seguir leyendo
Qué hace Mavox en cada área de tu empresa
Finanzas, tesorería, facturación electrónica, ventas, compras, inventario, nómina e informes, conectados sobre los mismos datos y con IA en cada área.
¿Por qué Mavox y no un ERP?
Un ERP guarda lo que tú escribiste. Mavox lee lo que te llega, lo registra, lo cruza y te avisa cuando no cuadra.
Cómo cobramos
Sin cobro por usuario y sin cláusula de permanencia. Qué va en la mensualidad y qué pagas al costo.
Pídele a nuestro agente lo que no puede hacer
En la demo haces las seis pruebas del contenedor tú mismo, con el agente real.