Del modelo misterioso al anuncio oficial: 3 días exprimiendo Ox Alpha en proyectos reales
Justo hace apenas un par de horas me ha aparecido este mensaje en el terminal de MiMo Code que he estado exprimiendo estos últimos 3 días para probar Ox Alpha:
«Thank you for participating in the Stealth Ox Alpha testing period. This model will be revealed today, August 26th.»
No os voy a contar lo que dicen los benchmarks, os voy a contar lo que me ha pasado utilizándolo. Han sido 3 días a «full» con el modelo, estoy con varios proyectos y lo he tenido revisando código, corrigiendo bugs y dando ideas de mejora, todo este tiempo y de forma gratuita.
El fenómeno «stealth» que sacudió OpenRouter
Todo empezó hace 3-4 días cuando me enteré que había un misterioso modelo que se podía probar gratuitamente en OpenRouter llamado «Ox Alpha». Este modelo apareció el 20 de agosto nada menos con una ventana de contexto de 1.048.576 tokens!, siendo multimodal (admite texto, imagen y video), y muy orientado a coding, razonamiento y tareas agénticas de larga duración.
Pero ¿Quién estaba detrás de Ox Alpha? Durante este tiempo los rumores se extendieron, ya se rumoreaba que podría ser de Z.ai, la gente que esta desarrollando la familia GLM de modelos.
Por cierto mientras estaba escribiendo el articulo me ha aparecido la confirmación del propietario en el mismo terminal,
Thank you for participating in the Stealth Ox Alpha testing period. This model was ZAI’s GLM-5.3 Flash. Use it now: https://openrouter.ai/z-ai/ glm-5.3-flash

¿Por qué todos hablaban de Ox Alpha?
Bueno de entrada tenía estos ingredientes mágicos: gratis + 1M de contexto + muy buen rendimiento en coding.
Según los datos publicados por OpenRouter, durante su periodo de prueba Ox Alpha llegó a superar los 23,2 billones de tokens procesados. Mira la imagen que han publicado en X. OpenRouter lo ha descrito como el modelo que más tráfico ha generado en su plataforma.

Mi experiencia tres días trabajando con Ox Alpha
Como he comentado estoy con varios proyectos, desde hace tiempo dedico muchas horas de mi tiempo libre a la programación. Este es mi repositorio de GitHub que no tengo actualizado porque son proyectos abiertos pero personales y muchas veces los dejo sin terminar porque me aparece otra idea. He aprovechado para subir alguno más.
Todos son proyectos basados en Python , y PHP/HTML/CSS principalmente. Absolutamente todos los utilizo en mi día a día , en el trabajo, para mis aficiones (la música y el baile Swing) etc y a medida que encuentro algo que necesito y creo que me puede ser útil lo desarrollo, tal cual .
Aunque he realizado varias formaciones, mis conocimientos de programación son limitados. Mi papel consiste sobre todo en definir qué necesito, el entorno y las reglas que debe seguir el proyecto —Python, PySide6, PyInstaller, Ruff, SoC, etc.— y dejar que agentes como OpenCode o MiMoCode hagan gran parte del trabajo.
En estos dos años he pasado por diferentes etapas: desde el autocompletado básico de Copilot en VS Code, pasando por los modelos conversacionales como ChatGPT, Gemini o Claude, donde había mucho «copy & paste», hasta los IDEs con capacidades agénticas como Cursor, Copilot Chat o Windsurf.
Ahora estoy en la etapa de los agentes autónomos, como Claude Code, OpenCode o MiMoCode: pequeños asistentes que pueden acceder directamente a las carpetas del proyecto, analizar el código, escribirlo, ejecutarlo y corregirlo bajo mi dirección.
Conclusiones de mi experiencia con Ox Alpha
Me gustó:
- Su gran capacidad para mantener el contexto
- Calidad del razonamiento
- Programación de muy alta calidad
- Capacidad para trabajar con proyectos grandes
- Seguimiento de instrucciones
- Ideas de mejora y capacidad para detectar problemas que yo no le había señalado
- ¡Y claro! que era totalmente gratisssss!!!!
Lo que menos me gusto:
- Sensación de «listillo», esa manía que tienen a veces ciertos modelos de sobre-diseñar o reestructurar partes del código que no les habías pedido tocar solo para demostrar su capacidad, en lugar de ceñirse a la instrucción exacta..
- Velocidad variable (imagino que los últimos días millones de personas lo estábamos utilizando)
- A veces se «enrollaba » demasiado para soluciones mucho más simples
Al final el misterio ha sido desvelado y sabemos que es un modelo de Z.ai, de la familia GLM, concretamente el GLM-5.3-Flash . Por el nombre y por el enfoque, parece responder a una estrategia similar: mantener una versión orientada a ofrecer buena capacidad de razonamiento y programación, pero con un perfil más eficiente y rápido para trabajar con agentes.
Pero ojo! Y hay otro detalle importante: estamos enviando nuestro código a un servicio externo. Z.ai ha confirmado que todo el tráfico de la prueba fue servido sobre chips de IA chinos, por lo que yo no utilizaría este tipo de servicios alegremente con código privado o información sensible.
En mi caso no tiene mayor importancia porque no hay datos sensibles ni privados.
Y ahora queda por ver qué tal se comporta fuera de este entorno. Z.ai ya ha publicado los pesos de GLM-5.3-Flash, aunque su despliegue local está inicialmente orientado a frameworks como SGLang, vLLM y TokenSpeed. Habrá que esperar para ver qué opciones aparecen para ejecutarlo de forma más accesible a nivel de usuario



