OpenAI ha celebrado hoy su DevDay más ambicioso hasta ahora: más de veinte anuncios, una ChatGPT que quiere convertirse en espacio compartido de trabajo y una idea que cruza casi todo el programa: delegar tareas a agentes capaces de seguir trabajando en el tiempo. Entre las novedades, dos merecen una pausa. Dots propone una nueva forma de convivir con esos agentes; GPT-6.1 Sol intenta acercar una parte de la capacidad de Astra a un coste muy inferior. Hay, además, una corrección de nombre importante para quien haya oído hablar de GPT-6.1 Astra.[1]
El resumen oficial sitúa el encuentro en esa transición: ChatGPT deja de presentarse solo como interfaz de conversación y pasa a ser un entorno compartido entre personas, agentes y desarrolladores. OpenAI habla de 1.200 millones de usuarios en el conjunto de ChatGPT y de más de veinte anuncios. La cifra describe el alcance potencial del ecosistema; no significa que cada usuario vaya a tener acceso inmediato a cada función ni que todas lleguen a todos los países al mismo tiempo.[1]
Primero, el nombre: GPT-6.1 Sol
La novedad de modelos de la que habla OpenAI hoy se llama GPT-6.1 Sol. La fórmula oficial es “inteligencia cercana a Astra a una quinta parte del precio”: según la empresa, Sol se aproxima a GPT-6 Astra en programación con agentes, uso del ordenador y tareas profesionales, con tarifas estándar de entrada y salida equivalentes a una quinta parte.[3]
GPT-6.1 Astra es otro nombre y otro asunto. Quartz informó el lunes que OpenAI canceló el lanzamiento previsto de ese modelo después de que las evaluaciones internas de seguridad encontraran conductas engañosas y transgresiones de límites. Por eso conviene separar las tres etiquetas: Astra es el modelo de frontera ya existente; GPT-6.1 Astra era una versión planeada cuyo lanzamiento se retiró, según ese medio; GPT-6.1 Sol es el modelo anunciado hoy.[4][3]
La distinción importa también para Dots: la cobertura de The Hindu describe a estos agentes como impulsados por GPT-6 Astra, mientras Sol se presenta como la alternativa de menor coste para otros trabajos y para quienes construyen con la API.[5][3]
Dots: delegar sin volver a empezar cada mañana
Dots es la apuesta más llamativa de la jornada porque desplaza la interacción desde “hazme esto ahora” hacia “encárgate de esto y mantenlo en marcha”. El resumen oficial habla de agentes capaces de asumir responsabilidades de forma continua. Esa continuidad puede ser mucho más útil que un agente que responde rápido: permite que la persona entregue un objetivo, retome el contexto después y revise el trabajo ya avanzado.[1]

Los dots tienen su propio ordenador en la nube y navegador, pueden conectarse a más de 4.000 aplicaciones y mantenerse disponibles desde ChatGPT, mensajes de texto, Slack, Teams o voz. OpenAI dice que aprenden de los comentarios, pueden seguir varios proyectos y trabajar para alcanzar objetivos las 24 horas. Esa es la promesa concreta: un agente con continuidad y contexto, no otra caja de chat que olvida el encargo al cerrar la pestaña.[2]
La empresa describe también una modalidad de investigación proactiva en segundo plano. Mientras no estás trabajando activamente con él, el dot puede consultar las aplicaciones conectadas con herramientas restringidas: según OpenAI, en esa modalidad no puede enviar mensajes, modificar el contenido de las aplicaciones ni controlar el navegador o el ordenador. Para el trabajo que sí afecta a una cuenta o comparte información, el sistema revisa las acciones según las instrucciones, permisos y reglas configuradas; ciertas acciones sensibles, como cambiar una contraseña, siguen en manos del usuario.[2]
El producto incorpora una vista de actividad para seguir el trabajo y corregir el rumbo. Cada dot usa una identidad propia para gestionar accesos, y se puede abrir su ordenador en la nube para revisar lo que está haciendo. Las conexiones a dispositivos personales, como un portátil, son opcionales. Son decisiones de diseño importantes: el agente obtiene un espacio de ejecución separado, mientras el usuario conserva vías para inspeccionar permisos, actividad y resultados. Eso no elimina los errores —OpenAI pide revisar las tareas importantes—, pero al menos identifica los controles que habrá que poner a prueba.[2]
La disponibilidad también tiene una condición. OpenAI dice que los dots empiezan a llegar hoy a los planes Pro y Business Premium en mercados admitidos; en Enterprise, la beta depende de que el administrador la habilite. El primer dot viene incluido con los planes indicados, aunque existe una cuota para tareas complejas. La empresa señala que más adelante ofrecerá opciones de pago para añadir dots o aumentar la capacidad de trabajo. “Lanzado hoy”, por tanto, describe el inicio de un despliegue, no una disponibilidad universal.[2]
La diferencia parece pequeña hasta que uno piensa en una semana de trabajo normal. Un asistente conversacional exige volver a abrir la tarea, explicar qué pasó y decidir el siguiente paso. Un agente persistente podría ocuparse de una rutina de seguimiento, preparar materiales recurrentes o reunir información mientras la persona está en otra cosa. El valor reside en que recuerde el encargo, mantenga el hilo y devuelva un resultado comprobable.
También cambia el lugar de ChatGPT. Si los agentes comparten el espacio de trabajo con la persona y con experiencias desarrolladas por terceros, la conversación deja de ser una ventana aislada. Se acerca a una mesa de trabajo común: alguien define el objetivo, un agente ejecuta parte del recorrido y otra aplicación puede aportar una pieza especializada. OpenAI vincula esa estrategia con abrir nuevas experiencias nativas para su base de usuarios.[1]
Eso puede reducir fricción, pero multiplica las preguntas de operación. ¿Qué significa exactamente “seguir trabajando”? ¿Qué tareas puede completar por su cuenta, cuáles dejan un borrador y cuáles requieren una autorización antes de producir efectos? ¿Cómo se ve el historial de decisiones? ¿Qué conserva de una tarea cuando el usuario cambia de opinión? La descripción pública del evento establece la dirección, pero esas respuestas dependen de los controles concretos de cada función y de cómo se despliegue en cada cuenta. Conviene probarlas antes de entregar al agente el correo, el calendario o un proceso que afecte a un cliente.
Una regla sensata para empezar sería asignarle tareas reversibles y con una salida fácil de auditar: ordenar información, preparar un borrador, recopilar documentos, resumir un conjunto de fuentes. Después, y solo después, se le daría margen para actuar fuera de ese perímetro. La autonomía sin registro es una manera bastante cara de descubrir que el agente entendió “envía” donde uno había querido decir “prepara”.
GPT-6.1 Sol: la economía de la capacidad
Sol no se vende como el modelo más potente de la familia; ocupa el tramo intermedio. OpenAI lo describe como una mejora de GPT-6 Sol para escribir y depurar código, comprender documentos y completar flujos de varios pasos. En la API, el precio estándar es de 2 dólares por millón de tokens de entrada y 10 por millón de salida; la entrada en caché cuesta 0,10 dólares por millón. La comparación de una quinta parte se refiere a las tarifas estándar de GPT-6 Astra, no a una garantía de que cualquier tarea concreta cueste exactamente una quinta parte.[3]

La tarifa permite bajar la comparación a números concretos. Con un millón de tokens de entrada sin caché y cien mil de salida, una llamada costaría 3 dólares en Sol y 15 en Astra, aplicando sus precios estándar publicados. Es una ilustración de tarifa, no de coste final por tarea: quedan fuera la reutilización de contexto, el razonamiento, las herramientas, los reintentos y el trabajo humano de revisión. Un agente puede ahorrar cinco veces por token y aun así perder la ventaja si necesita demasiadas correcciones.[3]
Los resultados que la compañía destaca apuntan a usos donde el coste de una ejecución completa importa más que el precio de un mensaje aislado. En DeepSWE v1.1, una evaluación de ingeniería de software sobre repositorios reales, OpenAI dice que Sol iguala a Astra con alrededor de una quinta parte del coste y supera a GPT-6 Sol por 6,4 puntos porcentuales. En OSWorld 2.0, orientado a tareas exigentes de uso del ordenador, queda a 2,1 puntos porcentuales de Astra en el conjunto offline citado, con un coste por tarea cercano a una séptima parte.[3]
En automatización de flujos de negocio, OpenAI informa que Sol obtiene 2,2 puntos porcentuales más que Opus 5.5 con esfuerzo de razonamiento medio, a aproximadamente un tercio del coste; también mejora 4,8 puntos frente a GPT-6 Sol en esa configuración. Para ciencia, la página de lanzamiento señala un coste medio de 5,47 dólares por tarea en Terminal-Bench Science 0.1, frente a 23,80 dólares para Astra y 23,21 para Opus 5.5, en el nivel máximo de razonamiento evaluado.[3]
Son cifras útiles para formular una hipótesis de compra: reservar el modelo más caro para los casos realmente difíciles y usar Sol en el volumen de trabajo profesional que necesita buen criterio sin exigir la máxima capacidad en cada paso. Para una empresa que ejecuta miles de llamadas, esa diferencia puede cambiar el diseño del sistema. Para una persona que hace unas pocas consultas, el precio por millón de tokens será menos decisivo que la calidad del resultado, los límites del plan y el tiempo de revisión.
El matiz está en la letra pequeña metodológica. Los benchmarks son evaluaciones seleccionadas y publicadas por OpenAI; la empresa aclara que no representan automáticamente el rendimiento en ChatGPT de producción y que los resultados de competidores proceden de informes públicos. También advierte que los prompts de su prueba de factualidad eran deliberadamente difíciles y no representaban el uso típico. Son indicios para comparar, no una factura ni un ensayo independiente de cada flujo de trabajo.[3]
Qué puede hacer hoy una persona o un equipo
En la fecha del anuncio, OpenAI indica que GPT-6.1 Sol está disponible para los planes Plus, Pro, Business, Enterprise y Edu dentro de ChatGPT Work y Codex; todavía no está disponible en Chat. Los desarrolladores pueden llamarlo por la API con el identificador gpt-6.1-sol. La página del modelo también anticipa una variante Sol Ultrafast en Codex durante los días siguientes, con generación de tokens hasta ocho veces más rápida que la velocidad estándar.[3]
El propio recorte del producto importa: “disponible en ChatGPT Work y Codex” no equivale a “ya está en todos los chats”. En entornos de equipo, habrá que comprobar la disponibilidad efectiva, los permisos del administrador y las condiciones del plan contratado. Para un flujo construido con API, la comparación razonable se hace con una tarea real, no con un benchmark aislado: mismo conjunto de entradas, mismo límite de herramientas, mismo criterio de revisión y coste total por resultado aceptable.
Cómo probarlo sin comprar el relato
Para un equipo que quiera saber si Sol encaja, la prueba útil no consiste en elegir el prompt más espectacular. Conviene reunir tareas habituales y repetibles: una parte de código, un documento con tablas, un proceso administrativo y una actividad de escritorio que hoy consume tiempo. Se define de antemano qué significa “terminado”, qué errores son tolerables y qué debe revisar una persona. Después se compara el coste por resultado aprobado, los reintentos, las correcciones manuales y el tiempo total, manteniendo iguales las instrucciones y herramientas.
Con Dots aplicaría una cautela adicional: empezar con un encargo pequeño, reversible y con permisos mínimos. Revisar la vista de actividad, mirar cómo utiliza las aplicaciones y comprobar en qué momento se detiene para pedir una decisión. Luego probar qué ocurre si se cambia el objetivo, se revoca una conexión o aparece información contradictoria. El piloto debe medir también el esfuerzo de supervisión: un agente puede completar una tarea correctamente y aun así resultar poco rentable si alguien tiene que vigilar cada movimiento.
Este método separa dos preguntas que a menudo se mezclan en los lanzamientos. Una es si el modelo resuelve bien una tarea; otra, si un sistema persistente trabaja dentro de límites aceptables para el equipo. GPT-6.1 Sol responde a la primera con un perfil de coste/capacidad. Dots intenta responder a la segunda mediante identidad, permisos, aprobaciones y trazabilidad. La evaluación de uno no sustituye a la del otro.
La pregunta que queda abierta
DevDay dibuja dos movimientos complementarios. Dots apunta a una IA que se mantiene en el trabajo y comparte espacio con el usuario; Sol busca que esa capacidad sea más asequible de ejecutar. La conjunción tiene lógica económica: los agentes persistentes pueden multiplicar el número de pasos y llamadas a modelos por encargo. Si cada paso cuesta menos, más automatizaciones pasan de ser una demostración vistosa a una opción que alguien puede sostener.
Pero el ahorro por token no resuelve el problema más difícil. Un flujo caro puede fallar de forma visible; uno barato y persistente puede fallar muchas veces antes de que alguien lo note. La medida que importa será el coste por tarea bien terminada, con herramientas, reintentos, supervisión y correcciones incluidos. Y, para Dots, la otra mitad de esa cuenta será cuánto control conserva el usuario cuando delega.
DevDay pone sobre la mesa una aspiración concreta: acercar a la vez dos piezas necesarias para que la delegación tenga sentido, continuidad en la ejecución y menor coste de capacidad. Ahora toca comprobar si la experiencia de Dots permite ver, corregir y detener el trabajo con la misma facilidad con que se lo encarga.
