Digital DevIDEAS PARA LO QUE VIENEHablemos de tu empresa
Volver al diarioDIARIO DIGITAL DEV

Agentes de IA: la próxima decisión es cómo darles autonomía

La conversación global sobre agentes avanza hacia identidad, interoperabilidad y evaluación. Qué significa para una empresa que quiere llevarlos a producción.

Ilustración conceptual de módulos conectados de metal y vidrio
Ilustración editorial generada con IA. No representa un registro noticioso.

LAS IDEAS CLAVE

  • 01

    El nivel de autonomía debe responder a la tarea y sus consecuencias.

  • 02

    Una integración abierta no sustituye la evaluación del resultado.

  • 03

    Las pruebas deben revisar acciones reales, excepciones y consistencia.

De generar respuestas a actuar sobre sistemas

La diferencia empresarial aparece cuando un sistema de IA puede utilizar herramientas y modificar el entorno en el que trabaja. A partir de ese momento, la pregunta incluye quién le concede acceso, qué tareas puede ejecutar y cómo se comprueba el resultado. El 17 de febrero de 2026, NIST anunció una iniciativa de estándares para agentes centrada en interoperabilidad, seguridad e identidad. Es una agenda de trabajo, no una certificación automática de los productos disponibles. NIST, AI Agent Standards Initiative.

Nuestra interpretación es que la autonomía debe tratarse como una decisión operativa que se puede graduar. Un agente que prepara una propuesta interna enfrenta exigencias distintas de otro que modifica un pedido. Elegir el mismo nivel de acceso para ambos dificulta tanto el control como la evaluación. Antes de comparar proveedores, conviene dibujar el recorrido completo de la tarea e identificar exactamente dónde el sistema pasaría de recomendar a ejecutar.

La conexión abierta necesita una decisión de arquitectura

La Linux Foundation anunció el 9 de diciembre de 2025 la Agentic AI Foundation, con contribuciones iniciales de MCP, goose y AGENTS.md. Estos proyectos cubren aspectos diferentes, desde conectar modelos con herramientas hasta entregar instrucciones de trabajo a agentes de programación. La iniciativa ofrece una estructura de colaboración abierta para ese ecosistema. Linux Foundation, anuncio de AAIF.

Para quienes compran tecnología en Chile, nuestra lectura práctica es revisar qué parte de una integración puede conservarse si cambia el modelo o el proveedor. Eso exige preguntar por exportación de datos, documentación, propiedad de los conectores y acceso al historial de ejecuciones. Adoptar un protocolo compartido puede ayudar a conectar componentes; por sí solo no demuestra que una solución sea portable, confiable o adecuada para todas las tareas de una compañía.

Medir el trabajo completo

En una guía publicada el 9 de enero de 2026, Anthropic explica que los agentes son más difíciles de evaluar porque actúan en varios pasos y alteran el estado del entorno. Propone definir tareas claras y combinar métodos de evaluación según el resultado esperado. Es orientación técnica de un proveedor con experiencia en estos sistemas; conviene contrastar su aplicación con las necesidades propias. Anthropic, Demystifying evals for AI agents.

Proponemos una evaluación empresarial que termine después de verificar el efecto de la acción. Si la tarea consiste en preparar un pedido, no basta con que la conversación diga que está listo: deben coincidir producto, cantidad, destinatario y estado final. El conjunto de pruebas debería incluir casos habituales y excepciones. También conviene repetir algunas tareas para observar consistencia, contabilizando las intervenciones humanas necesarias para cerrar el trabajo.

Un ejemplo para comenzar en una operación chilena

Imaginemos un distribuidor que quiere responder consultas sobre disponibilidad. Una primera versión puede recuperar antecedentes y preparar una respuesta para el equipo comercial. Una segunda podría crear un borrador de cotización. Una tercera podría actualizar un sistema después de una autorización definida. Este recorrido es ilustrativo. No presupone que la tercera etapa sea necesaria: el punto adecuado dependerá de los errores tolerables, los permisos disponibles y el valor que aporte cada paso.

Para comprobar utilidad, sugerimos observar tiempo hasta una respuesta correcta, consultas que se resuelven sin rehacer el trabajo y frecuencia de información desactualizada. Una respuesta rápida con un producto equivocado no debería contabilizarse como éxito. El diseño también necesita una salida clara cuando faltan antecedentes: derivar, explicar qué dato está ausente o detener la ejecución. Esas conductas se pueden incluir desde el inicio como parte de la prueba.

La autonomía necesita un responsable

Recomendamos asignar un dueño operativo a cada agente y mantener una descripción breve de su alcance. Debe quedar claro qué información consulta, qué acciones ejecuta y a quién corresponde resolver una excepción. El historial debería permitir reconstruir la solicitud y el resultado sin convertir los registros en una copia indiscriminada de información sensible. La profundidad necesaria depende del proceso, de las obligaciones aplicables y de la forma en que se administran los sistemas involucrados.

Antes de ampliar el uso, una revisión conjunta entre negocio y tecnología puede comparar beneficios observados, fallos pendientes y trabajo de mantenimiento. La recomendación editorial es conceder autonomía por evidencia acumulada en cada tarea. Ese enfoque permite aprovechar avances en modelos y herramientas sin hacer depender la operación de una demostración aislada. La ventaja competitiva estará en la capacidad de integrar, evaluar y mejorar estos sistemas con criterio propio.

CON TEXTO Y CONTEXTO

Fuentes y referencias

  1. Announcing the AI Agent Standards InitiativeNIST · 2026-02-17
  2. Formation of the Agentic AI FoundationLinux Foundation · 2025-12-09
  3. Demystifying evals for AI agentsAnthropic · 2026-01-09

Contenido elaborado con asistencia de IA a partir de las fuentes enlazadas. Las recomendaciones corresponden al análisis editorial de Digital Dev. Cómo elaboramos y corregimos nuestros artículos.