Durante los últimos días, he estado investigando un poco sobre Ornith-1. Por primera vez, tengo la impresión de disponer de un modelo local de alrededor de 35 mil millones de parámetros realmente creíble para realizar tareas agénticas: analizar un proyecto, modificar archivos, lanzar comandos, corregir errores y perseguir un objetivo en varias etapas.

35B MoEvariante utilizada principalmente durante mis pruebas
256Kventana de contexto máxima anunciada
303.000+descargas mostradas en Ollama al momento de escribir este artículo
45 minutospara terminar mi prueba en C en el MacBook Pro

01¿De dónde viene Ornith-1?

Ornith-1.0 fue lanzado en junio de 2026 por el equipo DeepReinforce. Este no es un modelo conversacional general simplemente etiquetado como "codificación". La familia recibió una capacitación posterior específica para tareas de programación agéntica, utilizando modelos de las familias Gemma 4 y Qwen 3.5.

Su particularidad proviene de su método de entrenamiento. DeepReinforce habla de self-scaffolding: durante el aprendizaje por refuerzo, el modelo no solo aprende a producir una solución. También aprende a mejorar la estructura que guía esta solución: estrategia de búsqueda, memoria de trabajo, gestión de errores y orquestación de herramientas.

Para simplificar, Ornith no sólo está entrenado para responder una pregunta. Está capacitado para organizar mejor su forma de resolver el problema. Esto es precisamente lo que se espera de un agente: observar, actuar, verificar, corregir y repetir hasta conseguir el resultado.

Especialización agéntica

El modelo está diseñado para utilizar herramientas, trabajar en una terminal y trabajar en repositorios de código.

Licencia MIT

Los puntos de control se publican bajo una licencia abierta sin restricciones regionales anunciadas.

Ejecución local

Las variantes 9B y 35B existen en GGUF y pueden funcionar con llama.cpp o Ollama.

02¿Por qué el modelo es tan popular?

Lo primero que me llamó la atención fue el mostrador Ollama. La página oficial mostró más de 303.000 descargas aproximadamente un mes después de que el modelo estuviera disponible. En Hugging Face, el total de contadores mostrados en los siete repositorios oficiales superó los 11 millones al momento de escribir este artículo.

Estas cifras deben interpretarse con cautela. Una descarga no representa necesariamente a una persona diferente. Un solo usuario puede recuperar múltiples variantes y los sistemas automatizados también pueden aumentar los contadores.

Sin embargo, muestran un interés genuino. Ornith llega en el momento adecuado: muchos usuarios buscan un modelo que no se limite a escribir una función aislada, sino que realmente sepa cómo trabajar en un proyecto.

  • una clara especialización en codificación agente;
  • variantes locales accesibles en GGUF;
  • una ventana de contexto anunciada en 256.000 tokens;
  • una licencia MIT fácil de entender;
  • integración directa en Ollama;
  • Resultados anunciados muy altos para los tamaños 9B y 35B.

03Las diferentes variantes de Ornith-1

modelo publicoArquitecturaFormatos visibles oficialesTamaño Ollama mostradoUso realista
Ornith-1.0-9BDenso, alrededor de 9BBF16 y GGUF5,6GBPruebas locales, soporte de código y máquinas con una cantidad razonable de memoria.
Ornith-1.0-35BMezcla de Expertos, 35BBF16, FP8 y GGUF21GBLa codificación local agente es seria, siempre que tenga memoria para el modelo y su contexto.
Ornith-1.0-397BMezcla de Expertos, 397BBF16 y FP8No se ofrece en la biblioteca oficial OllamaInfraestructura multi-GPU o servidor especializado, muy alejado de una máquina del público general.

El tamaño mostrado por Ollama es el archivo cuantificado distribuido, no la memoria total requerida. El contexto, la caché KV, los buffers y la herramienta del agente añaden un consumo importante.

04Los resultados anunciados por el editor

Los siguientes resultados son los publicados por DeepReinforce. Son útiles para situar a la familia, pero no sustituyen a las evaluaciones independientes. Los puntos de referencia también utilizan contextos amplios y entornos de agentes específicos.

ModeloBanco de terminales 2.1SWE-bench VerificadoBanco SWE ProNL2Repo
Ornith-1.0-9B43.169,442,927.2
Ornith-1.0-35B64.275,650,434,6
Ornith-1.0-397B77,582,462.248.2

El 35B es particularmente interesante. Según las cifras del editor, obtiene 64,2 en Terminal-Bench 2.1, frente a 52,5 en Qwen 3.6-35B. En SWE-bench Verified, la brecha es menor: 75,6 frente a 73,4. Esto confirma una idea importante: Ornith parece especialmente optimizado para realizar una tarea de agencia completa, no solo para generar código.

05Mi entorno de prueba

Máquina de IA casera

Dos NVIDIA RTX 3060 de 12 GB, o 24 GB de VRAM acumulativa, con RAM del sistema para absorber lo que no cabe en las GPU.

MacBook Pro M4

32 GB de memoria unificada compartida entre CPU y GPU. El modelo y su contexto tienen un espacio común, pero con muy poco margen.

Comparación de nubes

Codex con mi suscripción Pro y GPT-5.6 SOL, en una infraestructura remota cuyo hardware obviamente no controlo.

Mis pruebas de programación utilizan un contexto de al menos 64.000 tokens. Este punto es decisivo: el propio Ollama recomienda un mínimo de 64K para los agentes de código. Aumentar el contexto aumenta directamente el consumo de memoria.

El modelo Ornith 35B distribuido por Ollama ya pesa alrededor de 21 GB. En mis dos RTX 3060, por lo tanto, no queda suficiente VRAM para acomodar cómodamente el contexto, la caché KV y los buffers. Parte del trabajo se desborda a la RAM y a la CPU, con transferencias a través del bus PCIe.

ollama run ornith:35b

OLLAMA_CONTEXT_LENGTH=64000 ollama serve

ollama ps

ollama launch codex

06Prueba 1: crear un Flappy Bird

Mi primera prueba se convirtió en un clásico: pedirle al modelo que creara un Flappy Bird. El juego es sencillo de entender. Un pájaro avanza automáticamente, el jugador lo hace elevarse y debe evitar las tuberías.

Este tipo de proyectos está muy presente en datos públicos, tutoriales y ejemplos de GitHub. Sobre todo, permite comprobar rápidamente que el agente sabe crear varios archivos, elegir una tecnología, ejecutar el programa y corregir un posible error.

07Prueba 2: una calculadora en C con dos GPU RTX 3060

Para la segunda prueba, elegí deliberadamente algo menos convencional: una calculadora desarrollada en C, con una interfaz gráfica real inspirada en Windows 3.1.

No quería una calculadora Python hecha en unas pocas líneas con una biblioteca moderna. Quería empujar el modelo hacia un entorno más restrictivo: gestión de ventanas, botones, eventos, compilación nativa y adaptación a macOS.

Fue en ese momento que mis limitaciones materiales se hicieron visibles. El modelo cuantificado, el contexto de 64K y los datos del agente ya no caben cómodamente en los 24 GB de VRAM acumulativa. Ollama y llama.cpp distribuyeron la carga entre las dos GPU y la memoria del sistema.

Para un lector no especialista, el problema es simple: el modelo dedica parte de su tiempo a mover datos en lugar de calcular. Las tarjetas gráficas ya no funcionan en sus condiciones óptimas y el ritmo de generación se desploma.

08La misma prueba en un MacBook Pro M4

Interfaz de calculadora C generada por Ornith-1 35B en un MacBook Pro M4
Resultado de Ornith-1 35B ejecutado localmente: una calculadora C nativa funcional en MacBook Pro M4 después de una fase de corrección.

Volví a realizar el mismo ejercicio en mi MacBook Pro M4 equipado con 32 GB de memoria unificada. Cerré todas las aplicaciones para dejar la mayor cantidad de memoria posible en Ollama.

La Mac explotó durante unos 35 minutos, con la GPU utilizada al 100%. El primer resultado mostró una interfaz similar a una calculadora, pero los botones no funcionaban correctamente.

Le expliqué los problemas al modelo. Después de unos diez minutos más, editó el proyecto, volvió a compilar la aplicación y obtuvo una calculadora que funcionaba en C en macOS.

0 a 35 minutosGeneración del proyecto, creación de la interfaz y primera compilación.
Primer resultadoLa interfaz existe, pero las interacciones con los botones son defectuosas.
35 a 45 minutosDiagnóstico, corrección de eventos y nueva recopilación.
resultado finalUna calculadora nativa en C, compilada y funcionando en mi Mac.

La ganancia no proviene sólo de ocho gigabytes adicionales. La memoria unificada de Apple permite que la CPU y la GPU funcionen en el mismo espacio de memoria. Esto evita algunas transferencias entre la RAM del sistema y varias tarjetas gráficas dedicadas.

09Codex, Ollama y modo agente

Utilicé dos enfoques para comprobar si la herramienta de orquestación realmente cambió el resultado.

El primero fue lanzar Codex con Ollama como proveedor local. Ollama ahora ofrece el comando ollama launch codex, que configura Codex para usar un modelo local o remoto.

El segundo fue a través de la experiencia de línea de comandos iniciada desde Ollama, con una herramienta de agente real capaz de leer archivos, modificarlos, emitir comandos y continuar la tarea. Entonces no me refiero al simple gato obtenido con ollama run.

En mi configuración, este segundo enfoque produjo los mejores resultados. Parecía respetar mejor la configuración nativa del modelo y manejar mejor las sesiones largas. Codex conectado a la API Ollama funcionó, pero aprovechó de manera menos eficiente el contexto disponible en mi prueba.

10Comparación con GPT-5.6 SOL

Interfaz de calculadora de Windows 3.1 en C generada por Codex con GPT-5.6 SOL
Resultado comparativo obtenido con Codex y GPT-5.6 SOL: una calculadora en C inspirada en la interfaz de Windows 3.1.

Luego le pedí a Codex, con mi suscripción Pro y a GPT-5.6 SOL, que crearan la misma calculadora en C.

Como era de esperar, el primer resultado llegó mucho más rápido e inmediatamente pareció más exitoso. Lo curioso es que el modelo encontró exactamente el mismo problema: se mostraba la interfaz, pero era imposible hacer clic en los botones correctamente.

El modelo de nube, sin embargo, fue más expresivo en su diagnóstico. Identificó un problema con el manejo de escala y coordenadas en la pantalla Retina de Mac. Una segunda pasada completó la solicitud.

Configuracióntiempo observadoResultadoleyendo la prueba
Ornith-1 35B · 2 × RTX 3060 12 GBMás de una horaFallaModelo y contexto demasiado cerca del límite de memoria, con una alta proporción de descarga a la RAM y la CPU.
Ornith-1 35B · MacBook Pro M4 32 GBunos 45 minutosÉxito en dos pasesLa memoria unificada permite completar la tarea, pero sin mucho margen y con la GPU aprovechada al máximo.
GPT-5.6 SOL · Codex Prounos 10 minutosÉxito en dos pasesMás rápido y explícito en el diagnóstico, sobre una infraestructura en la nube mucho más potente.

Esta comparación no es justa en el sentido científico: los modelos, la infraestructura, las herramientas de cuantización y orquestación son diferentes. Sobre todo, mide lo que realmente obtiene un usuario con los medios a su disposición.

11Lo que realmente muestra esta prueba

Es una prueba estúpida y precisamente por eso es interesante. Si hubiera pedido una calculadora Python con una biblioteca de gráficos popular, Ornith probablemente habría terminado en unos diez minutos.

Mi objetivo era alejarme del camino más obvio y colocar el modelo en el borde: lenguaje C, GUI retro, compilación nativa de macOS, manejo de eventos y problema de escalado de Retina.

  • un modelo 35B ahora puede realizar una tarea de agencia local real;
  • la memoria disponible suele ser más determinante que el número teórico de parámetros;
  • un contexto de 64K transforma completamente los requisitos de hardware;
  • la herramienta del agente y su integración cuentan casi tanto como el modelo;
  • lo local sigue siendo significativamente más lento que un modelo de nube líder;
  • Los modelos locales están progresando lo suficientemente rápido como para cubrir nuevos usos.

Incluso hace seis meses, no hubiera imaginado obtener este tipo de resultado tan fácilmente con un modelo local de este tamaño. El peso del modelo sigue siendo decisivo, pero la formación, la orquestación y la especialización permiten ahora hacer más con menos material.

12¿Qué consecuencias para las empresas?

La cuestión ya no es simplemente cuál es el mejor modelo del mercado. La verdadera pregunta es qué nivel de potencia, privacidad y costo es necesario para cada uso.

UsarSolución realistaVentaja principalLímite principal
Reescritura de correo electrónico, breve resumen, clasificación.Pequeño modelo local como Gemma, Qwen o MistralDatos mantenidos localmente y bajo costo marginal.Razonamiento limitado sobre tareas complejas.
Asistente interno con documentos y RAGOpenWebUI con modelo local de 9B a 35BDominio de datos, cuentas y fuentes internas.Infraestructura y operaciones a mantener
Codificación agente en un repositorio realOrnith-1 35B con un contexto de 64K o másCódigo y propiedad intelectual mantenidos en el sitioAlto requisito de memoria y menor velocidad que la nube.
Tareas muy largas o razonamiento avanzado.Modelo de nube avanzado o máquina de memoria unificada de gran capacidadMejor calidad y rapidezCosto, dependencia de proveedores y gobernanza de datos

Una máquina DGX Spark o equivalente tiene 128 GB de memoria de sistema unificada. No son 128 GB de VRAM dedicada en el sentido clásico, pero esta arquitectura proporciona suficiente espacio para explotar localmente modelos y contextos que son imposibles de encajar cómodamente en una tarjeta de 24 GB.

También hay opciones intermedias. Una empresa puede recurrir a una empresa francesa como Mistral, cuyo Le Chat se ha convertido en Vibe, utilizar una oferta europea o implementar determinados modelos en su propia infraestructura. Puede reservar los modelos estadounidenses o chinos más potentes para tareas que realmente justifiquen la exposición y el costo.

Por lo tanto, debemos dejar de tratar la IA como una compra de licencia uniforme para todos los empleados. Las empresas deben experimentar, medir y definir sus propios niveles de servicio.

Y para ello no hace falta buscar en LinkedIn un perfil con un título inventado que se presenta como un experto absoluto en una tecnología que todos utilizamos desde hace sólo unos años. Hay que empezar retocando, probando, rompiendo, midiendo y empezando de nuevo. Ésta sigue siendo la mejor manera de comprender lo que es realmente posible.

SFuentes y detalles

Los recuentos de descargas, la disponibilidad de variantes y el rendimiento del tiempo de ejecución pueden cambiar rápidamente. Los valores presentados corresponden a la información visible al momento de escribir este artículo.