Skip to main content

Lo esencial

  • OpenAI añadió computer use a la Agents API el 29 de septiembre de 2026, según el changelog oficial de la compañía.
  • Computer use permite que un agente complete tareas dentro de un navegador alojado por OpenAI y use interfaces gráficas cuando no existe una API sencilla.
  • La aplicación del desarrollador gestiona aprobaciones de acceso a sitios web e inicio de sesión, según la documentación oficial de OpenAI.
  • GPT-6.1 Sol admite capacidades multiagente en beta para delegar partes de una solicitud a subagentes, según el changelog oficial.
  • Para empresas, el valor de computer use depende menos del clic automático y más del diseño de permisos, validaciones y supervisión humana.

openai computer use ya está en la Agents API desde el 29 de septiembre de 2026, según el changelog oficial de OpenAI. La novedad permite que agentes completen tareas dentro de un navegador alojado por OpenAI, con aprobaciones de acceso e inicio de sesión gestionados por la aplicación del desarrollador. Afecta sobre todo a equipos que quieren automatizar software web sin una API limpia para cada acción.

Qué es openai computer use en la Agents API

OpenAI computer use es una herramienta de Agents API que permite a un agente usar una interfaz de navegador alojada por OpenAI para completar tareas en aplicaciones web. La documentación oficial lo describe como una función para que el agente interactúe con sitios y aplicaciones mediante su UI, útil para probar webs, recopilar información o usar aplicaciones que no exponen todas sus acciones por API.

La noticia fue adelantada en español por Smarketing360 y encaja con el giro de OpenAI hacia agentes más operativos. La diferencia práctica es clara: ya no hablamos solo de generar texto, sino de sistemas que pueden abrir una herramienta web, leer una pantalla, rellenar campos, preparar una acción y detenerse si necesitan confirmación.

Según el changelog oficial de OpenAI, el 29 de septiembre de 2026 la compañía añadió computer use a la Agents API para que los agentes completen tareas en un navegador alojado por OpenAI.

En los proyectos que monto con pymes, esta capa tiene sentido cuando el proceso real vive entre tres o cuatro herramientas SaaS y nadie tiene presupuesto para una integración a medida. Pero también cambia el riesgo: un agente que actúa sobre una interfaz necesita límites más precisos que un chatbot que solo responde.

Lo esencial de Agents API computer use

Agents API computer use acerca la automatización con agentes IA a procesos que todavía dependen de pantallas, formularios y validaciones humanas. Si ya trabajas con flujos, RAG o agentes internos, lo relevante no es el navegador en sí, sino la posibilidad de cubrir huecos donde una API tradicional no llega.

  • Fecha: OpenAI registró la incorporación de computer use a la Agents API el 29 de septiembre de 2026 en su changelog oficial.
  • Entorno: el agente puede completar tareas en un navegador alojado por OpenAI, según la documentación de computer use.
  • Control: la aplicación del desarrollador gestiona aprobaciones de acceso a sitios web e inicio de sesión, según OpenAI.
  • Coste: la documentación oficial remite a tarifas de modelos, herramientas y contenedores; GPT-6.1 Sol figura en el changelog con precios por 1 millón de tokens.
  • Dirección: GPT-6.1 Sol soporta multiagente en beta, con delegación de partes del trabajo a subagentes dentro de una solicitud, según OpenAI.

Para entender por qué esto importa más allá del anuncio, compáralo con una automatización clásica: cuando la API existe, úsala. Cuando la acción solo se puede hacer en una interfaz web, computer use puede ser una opción, siempre que el proceso tenga reglas claras. Este enfoque conecta con lo que ya venimos trabajando en Agentic RAG bajo control: autonomía sí, pero con contexto, permisos y trazabilidad.

Bodegón con sellos, fichas de aprobación y candado para representar controles en agentes de IA
El valor empresarial aparece cuando el agente prepara acciones y una persona valida las sensibles.

Qué puede hacer un agente con navegador alojado por OpenAI

Un agente con navegador alojado por OpenAI puede interactuar con aplicaciones web cuando la tarea exige moverse por una interfaz y no solo llamar a una API. La guía oficial de computer use menciona pruebas de sitios web, recopilación de información y uso de aplicaciones mediante su interfaz de navegador.

Traducido a trabajo real, esto abre casos como recopilar datos de varios sistemas, preparar reportes en herramientas web, actualizar registros tras una validación o ejecutar tareas repetitivas que antes requerían clics manuales. La fuente original también cita esas posibilidades, con una condición importante: la empresa sigue necesitando reglas, permisos y controles.

Un ejemplo razonable sería un equipo comercial que recibe solicitudes en un formulario, contrasta datos en una herramienta interna y prepara una actualización en el CRM. El agente podría leer la solicitud, abrir la aplicación web correspondiente, localizar el registro y dejar preparada la modificación. La acción final —por ejemplo, cambiar estado, enviar propuesta o tocar un dato sensible— debería quedar a la espera de aprobación humana.

Este patrón se parece a los flujos que analizamos en agentes de IA en ventas, pero con una diferencia crítica: aquí el agente puede operar una interfaz. Eso aumenta el alcance y también obliga a diseñar escenarios de fallo: pantalla inesperada, sesión caducada, dato ambiguo, permiso insuficiente o acción irreversible.

Aprobaciones en agentes de IA: el punto crítico

Las aprobaciones en agentes de IA sirven para separar lo que el sistema puede preparar de lo que puede ejecutar sin intervención humana. Según la documentación oficial, la aplicación del desarrollador gestiona las aprobaciones de acceso a sitios web y el inicio de sesión, mientras OpenAI aloja el navegador en el entorno del agente.

La frase “con controles para accesos y aprobaciones” no es un detalle menor. Es la línea que separa un prototipo llamativo de una automatización implantable. En una empresa, el diseño debería distinguir al menos tres niveles: leer información, preparar cambios y ejecutar acciones.

  • Lectura: el agente consulta datos, recopila evidencias y resume el estado del proceso sin modificar nada.
  • Preparación: el agente rellena campos, genera borradores o deja una acción lista para revisar.
  • Ejecución: el agente confirma una operación, envía información o modifica registros con impacto operativo.

Mi criterio: computer use no debería empezar por ejecución autónoma. Debería empezar por lectura y preparación, con registros auditables y aprobación humana en los pasos que cambian datos, dinero, contratos, permisos o comunicaciones externas. Si no puedes explicar quién aprobó qué, cuándo y con qué información, el sistema no está listo para producción.

Este punto también toca cumplimiento. En Europa, cualquier automatización con datos personales debe pensarse con RGPD desde el diseño, y los agentes que actúan sobre software interno pueden acabar entrando en procesos regulados. Para una lectura más empresarial del riesgo, encaja con lo que tratamos en regulación IA para pymes.

Computer use frente a chatbot, API clásica y otros agentes

Computer use no sustituye a las APIs tradicionales: cubre el hueco donde una interfaz web es la única vía práctica para completar una acción. Un chatbot responde; una integración API ejecuta llamadas estructuradas; un agente con navegador puede trabajar con pantallas cuando el proceso no está bien expuesto por endpoints.

Enfoque Qué hace bien Riesgo principal Cuándo usarlo
Chatbot Responder, explicar, redactar y razonar sobre información aportada por el usuario. Puede parecer operativo aunque no ejecute acciones reales. Soporte, análisis, borradores, consultas internas y asistentes de conocimiento.
API clásica Ejecutar acciones fiables, trazables y estructuradas entre sistemas. Requiere endpoints disponibles, permisos técnicos e integración. Procesos estables, repetibles y críticos donde la API existe.
Computer use Usar interfaces web cuando no hay una API sencilla para cada acción. Fragilidad ante cambios de interfaz y necesidad de aprobaciones claras. Tareas con software web, validación humana y bajo volumen inicial.
Agente multiagente Dividir un trabajo complejo en subprocesos coordinados. Más complejidad de supervisión, evaluación y costes. Análisis, investigación, QA, codificación compleja y entregables con varias fases.

La documentación de arquitectura de Agents API diferencia entre entornos alojados por OpenAI y autoalojados. OpenAI recomienda openai_hosted cuando el agente necesita ejecutar scripts, editar archivos o crear artefactos, y self_hosted cuando necesita infraestructura propia, red privada o software personalizado. Esa distinción será importante para empresas con sistemas internos no expuestos a internet.

También hay una lectura competitiva. Anthropic, Google y OpenAI están empujando hacia agentes que hacen trabajo, no solo conversación. En nuestro análisis de Claude Opus para agentes ya se veía la misma presión: mejores modelos, menor coste relativo y más foco en tareas largas con herramientas.

Papeles ordenándose en una bandeja bajo un marco de navegador como metáfora de automatización con agentes
El caso útil no es hacer clic por hacer clic, sino convertir pasos repetitivos en flujo controlado.

Multiagente en GPT-6.1 Sol y límites que aún importan

GPT-6.1 Sol añade capacidades multiagente en beta para delegar partes de una solicitud a subagentes, según el changelog oficial de OpenAI. La idea es que una petición compleja pueda dividirse: un subagente recopila información, otro contrasta datos, otro revisa calidad y otro prepara el resultado final.

El changelog oficial del 29 de septiembre de 2026 también registra GPT-6.1 Sol para trabajo profesional y codificación compleja. Según OpenAI, sus precios estándar por 1 millón de tokens son 2 dólares de entrada, 0,10 dólares de entrada cacheada, 2,50 dólares por escritura de caché y 10 dólares de salida, con hasta 272K tokens de entrada.

Ahora bien, multiagente en beta no significa que cada empresa necesite montar una plantilla de agentes. En muchos procesos basta un agente con herramientas, una cola de tareas y aprobaciones. El multiagente tiene sentido cuando hay fases diferenciadas, criterios de calidad distintos y posibilidad real de verificar el trabajo de cada parte.

Los límites no desaparecen con computer use. Las interfaces cambian, las sesiones caducan, los permisos fallan, los datos pueden estar incompletos y el agente puede interpretar mal una pantalla. Además, a 5 de octubre de 2026, las fuentes oficiales consultadas no publican una disponibilidad específica para España o la UE separada de la disponibilidad general de la API.

Qué probaría hoy una empresa con OpenAI Agents API

Una empresa debería probar OpenAI Agents API con computer use en procesos de bajo riesgo, alto volumen manual y aprobación humana obligatoria. No empezaría por pagos, bajas contractuales, cambios de permisos o comunicaciones sensibles a clientes.

El piloto que recomiendo tendría cuatro piezas: una tarea concreta, un entorno controlado, permisos mínimos y una métrica de calidad. Por ejemplo: recopilar información de dos herramientas web, preparar un reporte operativo y dejarlo pendiente de aprobación. Si el agente no mejora tiempo, consistencia o trazabilidad en ese caso pequeño, no lo escalaría.

  • Proceso: elige una tarea que hoy haga una persona siguiendo pasos repetibles en una aplicación web.
  • Permisos: limita el agente a lectura y preparación antes de permitir cualquier modificación.
  • Aprobación: define qué decisiones paran el flujo y quién debe confirmarlas.
  • Registro: guarda entradas, acciones propuestas, aprobaciones y resultado final.
  • Coste: revisa tarifas de modelo, herramientas y contenedores en la página oficial de precios antes de escalar.

La documentación de sandboxes alojados por OpenAI indica que estos proporcionan al agente un espacio Linux con Python, Node.js y herramientas de línea de comandos, y que se cobran con las tarifas estándar de contenedor. Eso significa que el coste no será solo “tokens”: también hay que contar ejecución, herramientas y duración de los entornos.

Para pymes, el aprendizaje no es “dejar que la IA use el navegador”. El aprendizaje es diseñar trabajo delegable: entradas claras, reglas de decisión, puntos de parada y responsables. Esta misma lógica aparece en las oportunidades de automatización con IA para pymes: la tecnología avanza, pero el cuello de botella sigue siendo entender el proceso antes de automatizarlo.

Preguntas frecuentes

¿Qué es computer use en OpenAI Agents API?

Computer use en OpenAI Agents API es una herramienta que permite a un agente usar un navegador alojado por OpenAI para completar tareas en interfaces web. Según la documentación oficial, sirve para interactuar con sitios, recopilar información, probar webs o usar aplicaciones mediante su UI cuando una API no cubre todas las acciones.

¿Qué puede hacer un agente con un navegador alojado por OpenAI?

Un agente con navegador alojado por OpenAI puede completar tareas dentro de aplicaciones web usando una interfaz de navegador. Puede recopilar información, preparar reportes, interactuar con pantallas y dejar acciones listas para aprobación. La documentación oficial indica que la aplicación del desarrollador gestiona accesos, aprobaciones e inicio de sesión.

¿Cómo funcionan las aprobaciones en agentes de IA?

Las aprobaciones en agentes de IA separan las acciones que el sistema puede preparar de las que puede ejecutar. En este caso, OpenAI indica que la aplicación del desarrollador gestiona aprobaciones de acceso e inicio de sesión. En empresa, conviene exigir confirmación humana para cambios de datos, envíos, pagos o decisiones sensibles.

¿Qué diferencia hay entre un chatbot y un agente de IA?

Un chatbot responde a una entrada; un agente trabaja hacia un objetivo usando herramientas y ejecutando pasos. Con computer use, el agente puede interactuar con una interfaz web, no limitarse a redactar una respuesta. La diferencia práctica es que el agente puede preparar o completar trabajo operativo bajo permisos y controles.

¿Para qué sirve el trabajo multiagente en OpenAI?

El trabajo multiagente sirve para dividir una solicitud compleja en partes delegadas a subagentes. Según el changelog de OpenAI, GPT-6.1 Sol admite capacidades multiagente en beta. Tiene sentido en tareas con fases distintas, como recopilar información, analizar datos, revisar calidad y preparar un entregable final.

Fuentes