
Sky-T1-32B-Preview ha llegado para demostrar que entrenar un modelo de razonamiento avanzado no tiene por qué costar una fortuna. Según informes, la iniciativa del equipo NovaSky en UC Berkeley alcanzó un rendimiento similar al de o1-preview, todo ello con un gasto de menos de 450 dólares. Este logro promete revolucionar el desarrollo de la IA, poniendo al alcance de la comunidad recursos completos y abiertos para la investigación y la innovación.
Sky-T1 y el impulso hacia la IA abierta
La propuesta Sky-T1-32B-Preview se inspira en modelos como o1 y Gemini 2.0, conocidos por su capacidad de razonamiento profundo y por mostrar largos procesos de pensamiento interno. Sin embargo, los detalles técnicos y pesos de estos referentes no suelen estar disponibles para el público, dificultando la participación de investigadores independientes.
Ante esa limitación, el equipo NovaSky se enfocó en crear un proyecto totalmente open-source, liberando datos, código y pesos del modelo. Según la nota de prensa, la meta es que cualquier persona con interés académico o práctico pueda replicar estos resultados. De ese modo, se fomenta la colaboración y se impulsa el avance acelerado en la evolución de la IA.
Recursos e infraestructura compartida
Según informes, en el mismo repositorio se incluyen herramientas para la construcción de datos, entrenamiento y evaluación, así como la documentación necesaria para entender la arquitectura. Este enfoque de código abierto busca facilitar el acceso a la comunidad, eliminando barreras que antes impedían a muchos profesionales experimentar con modelos de gran escala.
El proyecto aporta 17.000 muestras para el entrenamiento de Sky-T1-32B-Preview, un informe técnico detallado y el registro wandb para visualizar las métricas. Este ecosistema permite a los curiosos explorar configuraciones, ajustar hiperparámetros y, en última instancia, aportar nuevas ideas que optimicen el rendimiento en diferentes tareas de razonamiento.
Cómo se procesaron los datos de entrenamiento
Para construir la base de conocimiento, se utilizó QwQ-32B-Preview, un modelo de razonamiento comparable a o1-preview. Mediante un proceso de refinado, se descartaron muestras incorrectas y se aplicó un procedimiento de reformateo con GPT-4o-mini. Según la fuente, esta metodología incrementó la exactitud en tareas de programación, reduciendo la incertidumbre sobre qué fragmento del contenido representaba la respuesta correcta.
Asimismo, se reforzó la calidad de las muestras de matemáticas y codificación al usar pruebas unitarias y métodos de verificación exacta. Con esta estrategia, el modelo finalizó con un conjunto de 5.000 datos de programación y 10.000 problemas de matemáticas, además de 1.000 muestras adicionales en áreas de ciencia y acertijos, basadas en Still-2.
Entrenamiento en tiempo récord y bajo coste
De acuerdo con la nota de prensa, el modelo partió de Qwen2.5-32B-Instruct para perfeccionar sus capacidades de razonamiento. El entrenamiento, que duró unas 19 horas, se realizó en un entorno de 8 H100 con DeepSpeed Zero-3 offload, sumando costes estimados en torno a 450 dólares, según Lambda Cloud. Esta cifra modesta demuestra que es posible emular el rendimiento de grandes modelos sin invertir sumas astronómicas.
El uso de Llama-Factory facilitó la optimización, así como la gestión de lotes de entrenamiento con tamaño 96 y una tasa de aprendizaje de 1e-5. Según la fuente, la escalabilidad de esta infraestructura abre las puertas a equipos pequeños para que innoven a niveles antes reservados para laboratorios con grandes presupuestos.
Resultados competitivos en diferentes tareas
Las evaluaciones muestran que Sky-T1-32B-Preview iguala o supera a algunos referentes: obtuvo 82.4% de aciertos en Math500 y 43.3% en AIME2024, compitiendo muy de cerca con o1-preview. Asimismo, en LiveCodeBench, logró porcentajes de éxito relevantes en ejercicios de dificultad variable, destacando en pruebas fáciles y medias.
No obstante, la mayor sorpresa surgió en GPQA-Diamond, donde consiguió 56.8% frente al 75.2% de o1-preview. Pese a no liderar la clasificación, el resultado demuestra que el modelo de NovaSky se acerca a los líderes sin tener acceso a enormes recursos. Esto confirma la hipótesis de que el costo no es la única vía hacia el desempeño de alto nivel.
Importancia del tamaño y la mezcla de datos
Según la fuente, entrenar modelos de menos de 32B (por ejemplo, 7B o 14B) no arrojó mejoras significativas. Estas versiones más pequeñas tendían a generar contenido repetitivo, mostrando limitaciones claras en tareas complejas como matemáticas y programación. De ahí la decisión de enfocar los esfuerzos en una arquitectura de 32B.
Igualmente, la composición de datos entrenados influyó en la precisión. Se observó que añadir demasiados problemas de codificación reducía la exactitud en matemáticas, y viceversa. Para equilibrar ambas habilidades, el proyecto combinó acertadamente el contenido de NuminaMATH con el del dataset TACO, logrando un rendimiento aceptable en ambos frentes.
Futuro de Sky-T1-32B-Preview y colaboraciones
El equipo de NovaSky anunció que continuará investigando métodos para optimizar los costos y el tiempo de entrenamiento sin perder potencia de razonamiento. Según la nota de prensa, su meta es crear modelos cada vez más eficientes, afinando procesos de inferencia y explorando técnicas de compresión que reduzcan el tamaño de los modelos manteniendo una sólida precisión.
En conclusión, Sky-T1-32B-Preview abre un mundo de posibilidades para la comunidad. Al ser completamente open-source, invita a desarrolladores y académicos a probar configuraciones, mejorar los algoritmos y compartir avances. Gracias a iniciativas como esta, la IA de alto nivel se hace más accesible, derrumbando barreras económicas y dejando claro que la innovación también pertenece a quienes sueñan con un futuro libre y colaborativo.
Fuente: https://novasky-ai.github.io/posts/sky-t1/