ia

Astra vs GPT-5.6 Sol: ¿Por qué el modelo 'diseñado para tareas largas' perdió en mi experimento?

Hace unos días salió ChatGPT 6, o Astra. Y como el hype estaba fuerte, decidí darle una tarea en Codex: crear un laboratorio de Machine Learning para predecir los resultados de la temporada de NFL.

Hice un pequeño brief y ejecuté un solo comando:

/goal ejecuta el proyecto definido en brief.md

Fue todo.


El desarrollo con Astra

Algunas horas después se detuvo porque agotó la cuota. Tocaba retomar la sesión.

Mismo prompt, cuatro veces durante el desarrollo:

“La cuota se agotó, ¿puedes continuar?”

Y continuaba.

El problema fue que, aunque Astra está optimizado para tareas largas, poco a poco perdió el enfoque.

El brief decía claramente:

No des por terminado el proyecto sin pasar por el set de pruebas científicas.

Pero le valió. 😅

Se saltó esos sets y dio por terminado el proyecto.


La auditoría con GPT-5.6 Sol

Entonces decidí auditar todo con GPT-5.6 Sol. Y aquí fue donde se puso interesante.

El trabajo de Astra era bueno. El problema no era que hubiera construido basura, sino que se había saltado parte del proceso de validación y eso provocaba que no detectara regresiones importantes.

Durante esos días leí varios posts comparando ambos modelos y, después de este experimento, coincido con algo que varios mencionaban:

GPT-5.6 Sol me funcionó mejor que Astra, incluso en una tarea larga.

5.6 también agotó su cuota durante la auditoría. La diferencia fue que pudo retomar el trabajo sin perder el contexto de lo que estaba haciendo.


Una variable clave: el flujo de trabajo

Aunque también hay una variable que no puedo descartar: la forma de trabajar con cada modelo.

ModeloEnfoque
AstraUtilicé /goal y prácticamente lo dejé trabajar solo
GPT-5.6 SolEl proceso fue conversacional

Y desde hace tiempo tengo la impresión de que los LLM funcionan mejor cuando trabajamos con ellos mediante conversaciones e iteraciones que cuando intentamos meter todo el problema dentro de una estructura rígida y esperamos el resultado final.


El resultado del experimento

El resultado del experimento está aquí: pickem.anuarbarrera.dev

La idea no es ganar un Pick’em ni demostrar que una IA puede predecir la NFL.

Es aprender.


Qué hace el laboratorio

El laboratorio compara diferentes modelos, baselines y algoritmos de Machine Learning. Cada semana podremos:

  1. Congelar sus predicciones
  2. Compararlas contra los resultados reales
  3. Medir qué modelos funcionan mejor
  4. Detectar errores y ajustar el entrenamiento

Y de paso aprender conceptos que todavía estoy estudiando:

  • Calibración
  • Brier Score
  • Log Loss
  • Stacking
  • Leakage
  • Walk-forward validation

La conclusión inesperada

Al final de este experimento, GPT-5.6 Sol me funcionó mejor que Astra.

Y eso es justamente lo que todavía no termino de entender.

En teoría, Astra está diseñado para destacar en tareas largas de programación y planeación. Era exactamente el tipo de problema donde esperaba que fuera claramente superior.

Pero en mi experimento ocurrió lo contrario.


Preguntas abiertas

No sé todavía si fue:

  • El modelo en sí
  • El comando /goal
  • La recuperación después de agotar la cuota
  • Mi brief
  • O simplemente que un flujo conversacional permite corregir pequeñas desviaciones antes de que se conviertan en errores grandes

Tu experiencia

¿Alguien más ha probado Astra y GPT-5.6 Sol en tareas largas?

Me interesa saber si han visto algo parecido.


¿Te interesa experimentar con IA y Machine Learning?

Comparto mis experimentos, aprendizajes y código en LinkedIn. Si eres desarrollador explorando IA aplicada, conectemos y continuemos la conversación allí.

Seguir en LinkedIn
💬

Únete a la comunidad de WhatsApp para emprendedores

Comparte dudas, tips y casos reales con otros dueños de PyMEs que están usando tecnología para hacer crecer su negocio. Es gratis.

Unirme a la comunidad →
← Volver al Blog