Durante los últimos días, he estado investigando un poco sobre Ornith-1. Por primera vez, tengo la impresión de disponer de un modelo local de alrededor de 35 mil millones de parámetros realmente creíble para realizar tareas agénticas: analizar un proyecto, modificar archivos, lanzar comandos, corregir errores y perseguir un objetivo en varias etapas.
01¿De dónde viene Ornith-1?
Ornith-1.0 fue lanzado en junio de 2026 por el equipo DeepReinforce. Este no es un modelo conversacional general simplemente etiquetado como "codificación". La familia recibió una capacitación posterior específica para tareas de programación agéntica, utilizando modelos de las familias Gemma 4 y Qwen 3.5.
Su particularidad proviene de su método de entrenamiento. DeepReinforce habla de self-scaffolding: durante el aprendizaje por refuerzo, el modelo no solo aprende a producir una solución. También aprende a mejorar la estructura que guía esta solución: estrategia de búsqueda, memoria de trabajo, gestión de errores y orquestación de herramientas.
Para simplificar, Ornith no sólo está entrenado para responder una pregunta. Está capacitado para organizar mejor su forma de resolver el problema. Esto es precisamente lo que se espera de un agente: observar, actuar, verificar, corregir y repetir hasta conseguir el resultado.
Especialización agéntica
El modelo está diseñado para utilizar herramientas, trabajar en una terminal y trabajar en repositorios de código.
Licencia MIT
Los puntos de control se publican bajo una licencia abierta sin restricciones regionales anunciadas.
Ejecución local
Las variantes 9B y 35B existen en GGUF y pueden funcionar con llama.cpp o Ollama.
Una llegada muy visible
El rendimiento anunciado, la compatibilidad con Ollama y los formatos cuantificados atrajeron inmediatamente a los usuarios de modelos locales.
02¿Por qué el modelo es tan popular?
Lo primero que me llamó la atención fue el mostrador Ollama. La página oficial mostró más de 303.000 descargas aproximadamente un mes después de que el modelo estuviera disponible. En Hugging Face, el total de contadores mostrados en los siete repositorios oficiales superó los 11 millones al momento de escribir este artículo.
Estas cifras deben interpretarse con cautela. Una descarga no representa necesariamente a una persona diferente. Un solo usuario puede recuperar múltiples variantes y los sistemas automatizados también pueden aumentar los contadores.
Sin embargo, muestran un interés genuino. Ornith llega en el momento adecuado: muchos usuarios buscan un modelo que no se limite a escribir una función aislada, sino que realmente sepa cómo trabajar en un proyecto.
- una clara especialización en codificación agente;
- variantes locales accesibles en GGUF;
- una ventana de contexto anunciada en 256.000 tokens;
- una licencia MIT fácil de entender;
- integración directa en Ollama;
- Resultados anunciados muy altos para los tamaños 9B y 35B.
03Las diferentes variantes de Ornith-1
| modelo publico | Arquitectura | Formatos visibles oficiales | Tamaño Ollama mostrado | Uso realista |
|---|---|---|---|---|
| Ornith-1.0-9B | Denso, alrededor de 9B | BF16 y GGUF | 5,6GB | Pruebas locales, soporte de código y máquinas con una cantidad razonable de memoria. |
| Ornith-1.0-35B | Mezcla de Expertos, 35B | BF16, FP8 y GGUF | 21GB | La codificación local agente es seria, siempre que tenga memoria para el modelo y su contexto. |
| Ornith-1.0-397B | Mezcla de Expertos, 397B | BF16 y FP8 | No se ofrece en la biblioteca oficial Ollama | Infraestructura multi-GPU o servidor especializado, muy alejado de una máquina del público general. |
El tamaño mostrado por Ollama es el archivo cuantificado distribuido, no la memoria total requerida. El contexto, la caché KV, los buffers y la herramienta del agente añaden un consumo importante.
04Los resultados anunciados por el editor
Los siguientes resultados son los publicados por DeepReinforce. Son útiles para situar a la familia, pero no sustituyen a las evaluaciones independientes. Los puntos de referencia también utilizan contextos amplios y entornos de agentes específicos.
| Modelo | Banco de terminales 2.1 | SWE-bench Verificado | Banco SWE Pro | NL2Repo |
|---|---|---|---|---|
| Ornith-1.0-9B | 43.1 | 69,4 | 42,9 | 27.2 |
| Ornith-1.0-35B | 64.2 | 75,6 | 50,4 | 34,6 |
| Ornith-1.0-397B | 77,5 | 82,4 | 62.2 | 48.2 |
El 35B es particularmente interesante. Según las cifras del editor, obtiene 64,2 en Terminal-Bench 2.1, frente a 52,5 en Qwen 3.6-35B. En SWE-bench Verified, la brecha es menor: 75,6 frente a 73,4. Esto confirma una idea importante: Ornith parece especialmente optimizado para realizar una tarea de agencia completa, no solo para generar código.
05Mi entorno de prueba
Máquina de IA casera
Dos NVIDIA RTX 3060 de 12 GB, o 24 GB de VRAM acumulativa, con RAM del sistema para absorber lo que no cabe en las GPU.
MacBook Pro M4
32 GB de memoria unificada compartida entre CPU y GPU. El modelo y su contexto tienen un espacio común, pero con muy poco margen.
Comparación de nubes
Codex con mi suscripción Pro y GPT-5.6 SOL, en una infraestructura remota cuyo hardware obviamente no controlo.
Mis pruebas de programación utilizan un contexto de al menos 64.000 tokens. Este punto es decisivo: el propio Ollama recomienda un mínimo de 64K para los agentes de código. Aumentar el contexto aumenta directamente el consumo de memoria.
El modelo Ornith 35B distribuido por Ollama ya pesa alrededor de 21 GB. En mis dos RTX 3060, por lo tanto, no queda suficiente VRAM para acomodar cómodamente el contexto, la caché KV y los buffers. Parte del trabajo se desborda a la RAM y a la CPU, con transferencias a través del bus PCIe.
ollama run ornith:35b
OLLAMA_CONTEXT_LENGTH=64000 ollama serve
ollama ps
ollama launch codex
06Prueba 1: crear un Flappy Bird
Mi primera prueba se convirtió en un clásico: pedirle al modelo que creara un Flappy Bird. El juego es sencillo de entender. Un pájaro avanza automáticamente, el jugador lo hace elevarse y debe evitar las tuberías.
Este tipo de proyectos está muy presente en datos públicos, tutoriales y ejemplos de GitHub. Sobre todo, permite comprobar rápidamente que el agente sabe crear varios archivos, elegir una tecnología, ejecutar el programa y corregir un posible error.
07Prueba 2: una calculadora en C con dos GPU RTX 3060
Para la segunda prueba, elegí deliberadamente algo menos convencional: una calculadora desarrollada en C, con una interfaz gráfica real inspirada en Windows 3.1.
No quería una calculadora Python hecha en unas pocas líneas con una biblioteca moderna. Quería empujar el modelo hacia un entorno más restrictivo: gestión de ventanas, botones, eventos, compilación nativa y adaptación a macOS.
Fue en ese momento que mis limitaciones materiales se hicieron visibles. El modelo cuantificado, el contexto de 64K y los datos del agente ya no caben cómodamente en los 24 GB de VRAM acumulativa. Ollama y llama.cpp distribuyeron la carga entre las dos GPU y la memoria del sistema.
Para un lector no especialista, el problema es simple: el modelo dedica parte de su tiempo a mover datos en lugar de calcular. Las tarjetas gráficas ya no funcionan en sus condiciones óptimas y el ritmo de generación se desploma.
08La misma prueba en un MacBook Pro M4
Volví a realizar el mismo ejercicio en mi MacBook Pro M4 equipado con 32 GB de memoria unificada. Cerré todas las aplicaciones para dejar la mayor cantidad de memoria posible en Ollama.
La Mac explotó durante unos 35 minutos, con la GPU utilizada al 100%. El primer resultado mostró una interfaz similar a una calculadora, pero los botones no funcionaban correctamente.
Le expliqué los problemas al modelo. Después de unos diez minutos más, editó el proyecto, volvió a compilar la aplicación y obtuvo una calculadora que funcionaba en C en macOS.
La ganancia no proviene sólo de ocho gigabytes adicionales. La memoria unificada de Apple permite que la CPU y la GPU funcionen en el mismo espacio de memoria. Esto evita algunas transferencias entre la RAM del sistema y varias tarjetas gráficas dedicadas.
09Codex, Ollama y modo agente
Utilicé dos enfoques para comprobar si la herramienta de orquestación realmente cambió el resultado.
El primero fue lanzar Codex con Ollama como proveedor local. Ollama ahora ofrece el comando ollama launch codex, que configura Codex para usar un modelo local o remoto.
El segundo fue a través de la experiencia de línea de comandos iniciada desde Ollama, con una herramienta de agente real capaz de leer archivos, modificarlos, emitir comandos y continuar la tarea. Entonces no me refiero al simple gato obtenido con ollama run.
En mi configuración, este segundo enfoque produjo los mejores resultados. Parecía respetar mejor la configuración nativa del modelo y manejar mejor las sesiones largas. Codex conectado a la API Ollama funcionó, pero aprovechó de manera menos eficiente el contexto disponible en mi prueba.
10Comparación con GPT-5.6 SOL
Luego le pedí a Codex, con mi suscripción Pro y a GPT-5.6 SOL, que crearan la misma calculadora en C.
Como era de esperar, el primer resultado llegó mucho más rápido e inmediatamente pareció más exitoso. Lo curioso es que el modelo encontró exactamente el mismo problema: se mostraba la interfaz, pero era imposible hacer clic en los botones correctamente.
El modelo de nube, sin embargo, fue más expresivo en su diagnóstico. Identificó un problema con el manejo de escala y coordenadas en la pantalla Retina de Mac. Una segunda pasada completó la solicitud.
| Configuración | tiempo observado | Resultado | leyendo la prueba |
|---|---|---|---|
| Ornith-1 35B · 2 × RTX 3060 12 GB | Más de una hora | Falla | Modelo y contexto demasiado cerca del límite de memoria, con una alta proporción de descarga a la RAM y la CPU. |
| Ornith-1 35B · MacBook Pro M4 32 GB | unos 45 minutos | Éxito en dos pases | La memoria unificada permite completar la tarea, pero sin mucho margen y con la GPU aprovechada al máximo. |
| GPT-5.6 SOL · Codex Pro | unos 10 minutos | Éxito en dos pases | Más rápido y explícito en el diagnóstico, sobre una infraestructura en la nube mucho más potente. |
Esta comparación no es justa en el sentido científico: los modelos, la infraestructura, las herramientas de cuantización y orquestación son diferentes. Sobre todo, mide lo que realmente obtiene un usuario con los medios a su disposición.
11Lo que realmente muestra esta prueba
Es una prueba estúpida y precisamente por eso es interesante. Si hubiera pedido una calculadora Python con una biblioteca de gráficos popular, Ornith probablemente habría terminado en unos diez minutos.
Mi objetivo era alejarme del camino más obvio y colocar el modelo en el borde: lenguaje C, GUI retro, compilación nativa de macOS, manejo de eventos y problema de escalado de Retina.
- un modelo 35B ahora puede realizar una tarea de agencia local real;
- la memoria disponible suele ser más determinante que el número teórico de parámetros;
- un contexto de 64K transforma completamente los requisitos de hardware;
- la herramienta del agente y su integración cuentan casi tanto como el modelo;
- lo local sigue siendo significativamente más lento que un modelo de nube líder;
- Los modelos locales están progresando lo suficientemente rápido como para cubrir nuevos usos.
Incluso hace seis meses, no hubiera imaginado obtener este tipo de resultado tan fácilmente con un modelo local de este tamaño. El peso del modelo sigue siendo decisivo, pero la formación, la orquestación y la especialización permiten ahora hacer más con menos material.
12¿Qué consecuencias para las empresas?
La cuestión ya no es simplemente cuál es el mejor modelo del mercado. La verdadera pregunta es qué nivel de potencia, privacidad y costo es necesario para cada uso.
| Usar | Solución realista | Ventaja principal | Límite principal |
|---|---|---|---|
| Reescritura de correo electrónico, breve resumen, clasificación. | Pequeño modelo local como Gemma, Qwen o Mistral | Datos mantenidos localmente y bajo costo marginal. | Razonamiento limitado sobre tareas complejas. |
| Asistente interno con documentos y RAG | OpenWebUI con modelo local de 9B a 35B | Dominio de datos, cuentas y fuentes internas. | Infraestructura y operaciones a mantener |
| Codificación agente en un repositorio real | Ornith-1 35B con un contexto de 64K o más | Código y propiedad intelectual mantenidos en el sitio | Alto requisito de memoria y menor velocidad que la nube. |
| Tareas muy largas o razonamiento avanzado. | Modelo de nube avanzado o máquina de memoria unificada de gran capacidad | Mejor calidad y rapidez | Costo, dependencia de proveedores y gobernanza de datos |
Una máquina DGX Spark o equivalente tiene 128 GB de memoria de sistema unificada. No son 128 GB de VRAM dedicada en el sentido clásico, pero esta arquitectura proporciona suficiente espacio para explotar localmente modelos y contextos que son imposibles de encajar cómodamente en una tarjeta de 24 GB.
También hay opciones intermedias. Una empresa puede recurrir a una empresa francesa como Mistral, cuyo Le Chat se ha convertido en Vibe, utilizar una oferta europea o implementar determinados modelos en su propia infraestructura. Puede reservar los modelos estadounidenses o chinos más potentes para tareas que realmente justifiquen la exposición y el costo.
Por lo tanto, debemos dejar de tratar la IA como una compra de licencia uniforme para todos los empleados. Las empresas deben experimentar, medir y definir sus propios niveles de servicio.
Y para ello no hace falta buscar en LinkedIn un perfil con un título inventado que se presenta como un experto absoluto en una tecnología que todos utilizamos desde hace sólo unos años. Hay que empezar retocando, probando, rompiendo, midiendo y empezando de nuevo. Ésta sigue siendo la mejor manera de comprender lo que es realmente posible.
SFuentes y detalles
- DeepReinforce — repositorio oficial de GitHub de Ornith-1
- DeepReinforce — presentación del método de self-scaffolding y puntos de referencia
- Hugging Face: modelos oficiales y variantes de DeepReinforce
- Ollama — Se muestran la biblioteca oficial de Ornith, tamaños y descargas
- Ollama — documentación sobre el tamaño del contexto y el consumo de memoria
- Ollama — integración oficial con Codex
- Ollama: descripción general del comando ollama launch
- NVIDIA — Especificaciones oficiales de DGX Spark
- Mistral — presentación de la empresa y sus posibilidades de implementación
Los recuentos de descargas, la disponibilidad de variantes y el rendimiento del tiempo de ejecución pueden cambiar rápidamente. Los valores presentados corresponden a la información visible al momento de escribir este artículo.




Comentarios
0 comentariosTodavía no hay comentarios publicados. Sé el primero en participar.