El director ejecutivo de Microsoft, Satya Nadella, planteó en una publicación que los sistemas de inteligencia artificial capaces de actuar por cuenta de una empresa necesitan controles que no dependan de la buena conducta del modelo. Su propuesta incluye registros verificables, límites sobre las acciones permitidas y un «freno de emergencia» que una persona autorizada pueda activar mientras el agente trabaja.
El argumento parte de un cambio concreto: un asistente que responde preguntas plantea riesgos distintos de uno que puede consultar archivos sensibles, usar herramientas y ejecutar tareas relevantes. En ese escenario, aceptar sin más las garantías del proveedor resulta insuficiente. La organización que concede acceso a sus datos y procesos sigue siendo responsable de lo que el sistema haga en su nombre.
Separar la inteligencia de la autoridad
El núcleo de la propuesta consiste en colocar los permisos y las barreras de seguridad fuera del modelo. La aplicación que coordina su trabajo debe determinar a qué información puede acceder, qué operaciones están autorizadas y cuándo necesita intervención humana. Si el propio modelo pudiera modificar esos límites o certificar que los respetó, el control perdería independencia justo cuando más se necesita.
Nadella compara este enfoque con el tratamiento de un posible riesgo interno en una empresa. La comparación no supone que los modelos sean maliciosos: reconoce que un sistema poderoso puede equivocarse, recibir instrucciones dañinas o quedar comprometido. Por eso propone asumir desde el diseño que debe ser posible contenerlo, con una persona facultada para pausarlo o apagarlo a mitad de una tarea.
Evidencia que no dependa del propio modelo
La trazabilidad ocupa otro lugar central. Cada acción importante debería dejar un registro legible para humanos y resistente a manipulaciones, de modo que una auditoría pueda reconstruir cómo se llegó a un resultado. El modelo no tendría que ser el único testigo de su propio comportamiento ni el encargado exclusivo de evaluar si cumplió las reglas originales.
Ese principio también exige probar fallos, ataques y cambios del sistema, además de las tareas que terminan bien. El directivo defiende la diversidad de modelos para evitar que una sola tecnología se convierta en dependencia absoluta o revise su propio trabajo. Son medidas de ingeniería y gobernanza que pueden evaluarse por separado de la capacidad del modelo para producir respuestas convincentes.
Qué implica para las empresas que despliegan agentes
En una empresa, traducir la propuesta significaría delimitar identidades, reducir privilegios, registrar operaciones y fijar procedimientos para intervenir cuando algo se desvía. También incluiría comunicar oportunamente los incidentes a los afectados y compartir lo aprendido sobre los controles que fallaron. Es una agenda de diseño, no el anuncio de que exista ya un estándar universal ni una función nueva lista para instalarse.
La dificultad práctica es que las acciones de un agente pueden encadenarse rápidamente entre distintas herramientas, mientras que una revisión humana detallada consume tiempo.
Un freno útil tendría que funcionar durante la ejecución, y los registros deberían permitir entender decisiones complejas sin confiar ciegamente en el relato generado por la misma IA. La propuesta, por tanto, plantea requisitos verificables para quienes construyen estos sistemas.
El mensaje desplaza el debate desde cuánto confiar en un modelo hacia cuánto control conserva quien lo utiliza. Si una organización puede limitar accesos, inspeccionar efectos y detener una tarea, tiene mejores condiciones para adoptar agentes en procesos delicados. Si no puede hacerlo, una respuesta brillante en pantalla ofrece poca garantía sobre lo que ocurrió detrás.
