• Tech Support ⤴
  • Projects
  • Services
    • AI Development
    • UI/UX Design
    • Web Development
    • Technology Support
    • Mobile App Development
    • Banking ATM Interfaces
    • Process Automation
    • Security Auditing
    • Local AI Servers
  • odoo ERP
get in touchStart with Eva
logo
Tech Support ⤴
Projects
Services
AI DevelopmentUI/UX DesignWeb DevelopmentTechnology SupportMobile App DevelopmentBanking ATM InterfacesProcess AutomationSecurity AuditingLocal AI Servers
odoo ERP
get in touchStart with Eva
Loading…
logo

Transforming businesses through AI-powered digital innovation and creative excellence.

Quick Links

BlogAinexProjectsContact us

Contact Us

pinDubai Digital Park, A5, DTEC - Silicon Oasisemail[email protected]phone+971 55 7538087
© 2026 aratech. All rights reserved.
Privacy PolicyTerms of ServiceCookie Policy
Inicio / Blog / Ornith 1.0: El modelo de codificación IA de código abierto que escribe sus propios andamios RL

Ornith 1.0: El modelo de codificación IA de código abierto que escribe sus propios andamios RL

DeepReinforce lanzó Ornith 1.0, un modelo de IA de código abierto que presenta LLM auto-andamiantes para codificación agéntica — modelos que aprenden a escribir sus propias herramientas de aprendizaje por refuerzo. Con la variante 397B MoE igualando a Claude Opus 4.7 en SWE-Bench y la versión 9B superando a modelos tres veces más grandes, esto es un cambio de paradigma para el desarrollo de IA de código abierto.

26 de junio de 2026 - 12 min de lectura

Puntos clave

ExpandCollapse
  • - Ornith 1.0 es la primera familia de modelos de código abierto que aprende conjuntamente a resolver tareas de codificación Y a escribir sus propios andamios de entrenamiento RL
  • - La variante 397B MoE obtiene 82.4 en SWE-Bench Verified y 77.5 en Terminal-Bench 2.1 — igualando o superando a Claude Opus 4.7
  • - El modelo denso 9B (43.1 TB-2.1, 69.4 SWE-Bench) supera a Gemma 4-31B y Qwen 3.5-35B — modelos 3-4x más grandes
  • - Todos los modelos publicados bajo licencia MIT con soporte GGUF para Ollama y despliegue local
  • - El auto-andamiaje representa un cambio fundamental: el modelo desarrolla su propia estrategia de orquestación
  • - Defensa de tres capas contra el hackeo de recompensas: límite de confianza fijo, monitoreo determinista y juez LLM congelado
Ornith 1.0 — Modelo de codificación IA auto-andamiante de DeepReinforce. Miniatura de video de YouTube con Sam Witteveen.

DeepReinforce acaba de lanzar algo que cambia las reglas del juego para la codificación con IA de código abierto. Ornith 1.0 no es solo otro lanzamiento de modelo — es un nuevo paradigma de cómo los agentes de IA aprenden a escribir código.

Lo esencial: una familia de modelos completamente de código abierto (de 9B a 397B parámetros, todos con licencia MIT) que se enseña a sí misma a escribir sus propios andamios de aprendizaje por refuerzo. La variante más grande iguala a Claude Opus 4.7 en SWE-Bench Verified. El modelo más pequeño de 9B supera a Gemma 4-31B — un modelo 3 veces más grande.

Analicemos qué hace diferente a este lanzamiento.


¿Qué es Ornith 1.0?

Ornith 1.0 es una familia de modelos de código abierto auto-mejorantes construidos específicamente para tareas de codificación agéntica, desarrollada por DeepReinforce. Abarca cuatro tamaños:

  • Ornith 1.0 9B Dense — Desplegable en el borde, funciona en hardware de consumo
  • Ornith 1.0 31B Dense — Rendimiento equilibrado para despliegue en estaciones de trabajo
  • Ornith 1.0 35B MoE — Mezcla de expertos para inferencia eficiente
  • Ornith 1.0 397B MoE — Escala fronteriza, igualando a los líderes de código cerrado

Construidos sobre los puntos de control preentrenados de Gemma 4 y Qwen 3.5, estos modelos logran resultados de vanguardia entre los modelos de código abierto de tamaño comparable en los principales benchmarks de codificación.


La innovación principal: el auto-andamiaje

Aquí es donde se pone interesante. Cada sistema de codificación agéntica — ya sea Claude Code, Cursor o un agente de código abierto — depende de un andamio (scaffold): la lógica de orquestación que estructura cómo el modelo interactúa con las herramientas, gestiona el contexto, reintenta en caso de fallo y entrega una solución final.

Hasta ahora, los andamios eran diseñados manualmente por humanos. Tú escribes el armazón, defines el protocolo de uso de herramientas, estructuras la recuperación de errores. El modelo solo completa el código.

Ornith 1.0 invierte esto. Su marco de entrenamiento optimiza conjuntamente el andamio Y la solución. Cada paso de RL funciona en dos etapas:

  1. Proponer un andamio refinado — condicionado por la tarea y el andamio utilizado previamente
  2. Generar un despliegue de solución — condicionado por ese andamio y la descripción de la tarea

La recompensa del despliegue se propaga a ambas etapas. El modelo no solo aprende a escribir mejores respuestas — aprende a crear la orquestación que suscita esas respuestas.

Self-scaffolding training framework

Bucle RL de dos etapas de Ornith: la propuesta de andamio y la generación de solución se optimizan conjuntamente, creando un bucle de retroalimentación donde el modelo mejora continuamente su propia estrategia de orquestación.

La inmersión profunda de Sam Witteveen en Ornith 1.0 lo dice bien — esto no es una mejora incremental. Es un cambio estructural de "entrenar al solucionador" a "entrenar al andamio + solucionador juntos."


Rendimiento en benchmarks: golpeando por encima del peso

Los números hablan por sí mismos. Veamos cómo se compara Ornith con la competencia.

Escala fronteriza (397B MoE)

BenchmarkOrnith 1.0 397BClaude Opus 4.7DeepSeek-V4-ProMiniMax M3
Terminal-Bench 2.1 (Terminus-2)77.570.367.966.0
SWE-Bench Verified82.480.880.680.5
SWE-Bench Pro62.264.355.459.0
SWE-Bench Multilingual78.9—76.2—
NL2Repo48.2——42.1

Ornith 1.0 397B supera a Claude Opus 4.7 tanto en Terminal-Bench 2.1 como en SWE-Bench Verified, y lidera frente a DeepSeek-V4-Pro y MiniMax M3 en casi todas las métricas.

397B Evaluation Results

Ornith 1.0 397B vs. modelos fronterizos líderes — note el liderazgo general en benchmarks de codificación agéntica.

Escala media (35B MoE)

BenchmarkOrnith 1.0 35BQwen 3.5-35BQwen 3.6-35BGemma 4-31B
Terminal-Bench 2.164.241.452.542.1
SWE-Bench Verified75.670.073.452.0
SWE-Bench Pro50.444.649.535.7
NL2Repo34.620.529.415.5

La variante 35B no solo supera a modelos de tamaño similar — supera al modelo 397B de Qwen 3.5 en Terminal-Bench 2.1 (64.2 vs 53.5). Es una desventaja de parámetros de 10x superada por un entrenamiento más inteligente.

35B Evaluation Results

Escala de borde (9B Dense)

BenchmarkOrnith 1.0 9BQwen 3.5-9BGemma 4-12BGemma 4-31B
Terminal-Bench 2.143.121.321.042.1
SWE-Bench Verified69.453.244.252.0
SWE-Bench Pro42.931.327.635.7

¿Un modelo de 9B superando a un modelo de 31B en SWE-Bench Verified? Ese es el poder del entrenamiento de auto-andamiaje. Para equipos que necesitan agentes de codificación locales, privados y sin conexión, este es un momento crucial.

9B Evaluation Results


Cómo funciona: el marco de entrenamiento auto-mejorante

Vale la pena entender la arquitectura técnica porque indica hacia dónde se dirige todo el campo.

El bucle de retroalimentación

El RL tradicional para codificación utiliza un armazón fijo. Tú defines cómo el modelo interactúa con la terminal, cómo lee archivos, cómo ejecuta pruebas — y el modelo optimiza su salida de código dentro de esas restricciones. El armazón nunca cambia.

Ornith trata el armazón como un objeto aprendible. A lo largo de las iteraciones de entrenamiento:

  1. El modelo propone un andamio para una categoría de tarea dada
  2. Genera una solución usando ese andamio
  3. La recompensa de la solución se propaga para actualizar tanto la política de solución COMO la política de andamio
  4. Mejores andamios conducen a mejores soluciones, que a su vez refinan los andamios

Esto crea un volante de capacidad autónoma — uno que no requiere ingenieros humanos para rediseñar manualmente el bucle del agente cada vez que el modelo mejora.

Defensa contra el hackeo de recompensas

Dar al modelo control sobre su propio andamio introduce un riesgo obvio: hackeo de recompensas. ¿Qué lo detiene de aprender a engañar los benchmarks en lugar de resolver realmente problemas de codificación?

DeepReinforce implementa una defensa de tres capas:

Capa 1: Límite de confianza fijo. El entorno, la superficie de herramientas y el aislamiento de pruebas son inmutables y están fuera del alcance del modelo. El modelo solo puede evolucionar su andamio de política interna — memoria, manejo de errores, lógica de orquestación.

Capa 2: Monitoreo determinista. Un monitor aplica el límite, señalando intentos de leer rutas retenidas, modificar scripts de verificación o invocar acciones fuera de la superficie de herramientas autorizada. Sin recompensa por violaciones.

Capa 3: Juez LLM congelado. Debido a que el engaño a nivel de intención puede ocurrir dentro de las superficies de herramientas permitidas, un LLM congelado actúa como un veto sobre el verificador. Si el juez detecta comportamiento engañoso incluso dentro del uso válido de herramientas, la trayectoria es penalizada.

Este enfoque de tres capas es una arquitectura de referencia para cualquiera que construya sistemas de agentes auto-mejorantes.

RL asíncrono a escala

El entrenamiento se realizó con una estrategia de RL en pipeline para manejar el problema fuera de política creado por los largos despliegues agénticos. Un peso de obsolesencia reduce el peso de los tokens más antiguos y los elimina por completo una vez que se supera un umbral. Esto permite que el entrenamiento escale a las trayectorias de horizonte largo que la codificación agéntica requiere.


Por qué esto es importante para la IA empresarial

Ornith 1.0 no es solo un hito de investigación — tiene implicaciones prácticas inmediatas.

1. Los pesos abiertos cambian el cálculo de riesgos

Todos los puntos de control de Ornith 1.0 tienen la licencia MIT. Las versiones GGUF funcionan en Ollama y Unsloth sin ninguna barrera de acceso. Para industrias reguladas (finanzas, salud, defensa), esto significa:

  • El código nunca tiene que salir de tu infraestructura
  • Puedes auditar y modificar el comportamiento del agente
  • Sin dependencia de los precios o disponibilidad de API
  • Es posible el ajuste fino personalizado para bases de código propietarias

2. El flujo de trabajo, no solo el modelo, determina los resultados

Ornith 1.0 demuestra que el diseño de andamios es ahora un diferenciador competitivo. Dos equipos que usan el mismo modelo base pueden obtener resultados radicalmente diferentes dependiendo de su lógica de orquestación. El modelo que puede evolucionar su propia orquestación se adelantará.

3. La capacidad fluye hacia aguas abajo

El rendimiento del modelo 9B es quizás la señal más importante aquí. Significa que la capacidad de codificación agéntica — una vez dominio de despliegues masivos en centros de datos — se está volviendo accesible en portátiles y dispositivos de borde. La asistencia de codificación privada, sin conexión y en tiempo real ahora es factible.

4. La brecha del código abierto se está cerrando

CategoríaClaude Opus 4.7Ornith 1.0 397BBrecha
SWE-Bench Verified80.882.4+1.6
Terminal-Bench 2.170.377.5+7.2
SWE-Bench Pro64.362.2-2.1

La brecha entre los mejores modelos de código cerrado y abierto en benchmarks de codificación agéntica es efectivamente cero. Para muchos casos de uso, Ornith 1.0 ya lidera.


Conclusión

Ornith 1.0 es el lanzamiento de codificación agéntica de código abierto más importante de 2026 hasta ahora. Valida una tesis que muchos en la comunidad de IA sospechaban pero que nadie había probado a escala: optimizar conjuntamente el andamio y el solucionador produce mejores resultados que optimizar cualquiera de ellos de forma aislada.

Para CTOs y líderes de ingeniería que evalúan su estrategia de IA, las implicaciones son claras:

  • Ahora puedes ejecutar codificación agéntica de calidad de producción completamente en tu propia infraestructura con pesos abiertos
  • La ventaja competitiva se desplaza del acceso a modelos al diseño de orquestación y herramientas personalizadas
  • Los agentes auto-mejorantes que evolucionan sus propios flujos de trabajo ya no son teóricos — se están enviando ahora

En aratech, seguimos este espacio de cerca. Si estás evaluando cómo los modelos de auto-andamiaje encajan en tu arquitectura de IA o quieres comparar Ornith 1.0 con tu base de código privada, ponte en contacto.

Mira el análisis completo de Sam Witteveen sobre Ornith 1.0 en YouTube para un recorrido práctico de los modelos y sus capacidades.

Tabla de contenido

  • ↗¿Qué es Ornith 1.0?
  • ↗La innovación principal: el auto-andamiaje
  • ↗Rendimiento en benchmarks: golpeando por encima del peso
  • ↗Escala fronteriza (397B MoE)
  • ↗Escala media (35B MoE)
  • ↗Escala de borde (9B Dense)
  • ↗Cómo funciona: el marco de entrenamiento auto-mejorante
  • ↗El bucle de retroalimentación
  • ↗Defensa contra el hackeo de recompensas
  • ↗RL asíncrono a escala
  • ↗Por qué esto es importante para la IA empresarial
  • ↗1. Los pesos abiertos cambian el cálculo de riesgos
  • ↗2. El flujo de trabajo, no solo el modelo, determina los resultados
  • ↗3. La capacidad fluye hacia aguas abajo
  • ↗4. La brecha del código abierto se está cerrando
  • ↗Conclusión

Artículos relacionados

Arte digital cyberpunk oscuro que muestra un escudo agrietado con circuitos de neón púrpura y cian sobre una silueta de estadio, representando la brecha de seguridad HSIN del DHS durante la Copa Mundial 2026

Red de Seguridad del Mundial Hackeada: La Plataforma de Inteligencia del DHS Comprometida Durante Semanas

Hackers infiltraron la Red de Información de Seguridad Nacional del DHS durante la Copa Mundial FIFA 2026, obteniendo semanas de acceso sin ser detectados. La intrusión fue descartada dos veces como un falso positivo.

Necolas HamwiNecolas Hamwi
5 de agosto de 2026 - 7 min de lectura
Visualización cyberpunk de una planta de tratamiento de agua bajo asedio digital con patrones de circuitos neón y símbolos de advertencia holográficos

Guerra del Agua: El Ciberataque Que Interrumpió 30 Plantas de Agua en 7 Estados

En 48 horas a finales de julio de 2026, más de 30 servicios de agua en siete estados de EE. UU. fueron atacados por un ciberataque coordinado iraní contra controladores industriales. Esto es lo que pasó y lo que todo operador de infraestructura crítica debe saber.

Necolas HamwiNecolas Hamwi
4 de agosto de 2026 - 7 min de lectura
Ilustración cyberpunk de un atraco bancario digital con agentes de IA

Atracos Bancarios Modernos 2026: La Guerra a Velocidad de Máquina por el Control Financiero

El informe 2026 de TrendAI revela una guerra a velocidad de máquina por el control financiero: aumento del 89% en ataques con IA, 67% de instituciones que sufren respuesta contraria a incidentes, y atacantes que pasan del robo a la destrucción. ¿Tu ciberseguridad está a la altura?

Necolas HamwiNecolas Hamwi
3 de agosto de 2026 - 7 min de lectura