[go: up one dir, main page]

Ir al contenido principal

Bonsai 2 27B: ejecuta una IA de 27B en tu portátil

Bonsai 2 27B de PrismML comprime un modelo multimodal de 27B hasta 5,9 GB manteniendo el 98,2% del rendimiento en precisión completa, y se ejecuta en un portátil.
Actualizado 23 sept 2026  · 9 min leer

Explorar con IA

ChatGPTClaudePerplexity

La mayoría de los lanzamientos de modelos que he cubierto este año persiguen lo mismo: una ventana de contexto más grande, una puntuación más alta en SWE-bench, otro billón de parámetros.

PrismML va en la dirección contraria.

El 17 de septiembre de 2026, el equipo lanzó Ternary Bonsai 2 27B, una versión comprimida de Qwen3.8 27B que cabe en 5,9 GB y se ejecuta en un portátil.

Al comprimir de forma agresiva cómo almacena la información, PrismML hizo Bonsai 2 27B más de 9 veces más pequeño que la versión original de Qwen. Aun así, conserva el 98,2% de su rendimiento y la ventana de contexto de 262k tokens, procesando texto e imágenes.

En este artículo repaso todo lo nuevo de Bonsai 2 27B: novedades, benchmarks y un desglose de precio y acceso.

Si quieres ejecutar tú mismo el primer modelo Bonsai, tenemos una guía paso a paso en nuestro tutorial de instalación local de Bonsai 27B.

Resumen

  • Bonsai 2 27B comprime Qwen3.8 27B hasta 5,9 GB manteniendo el 98,2% de su rendimiento agregado en benchmarks.
  • Lo importante es dónde se conserva la capacidad: matemáticas y programación se mantienen a la par; conocimiento y visión son los que más caen.
  • Se ejecuta en local en GPUs NVIDIA vía CUDA y en dispositivos Apple vía MLX, alcanzando 143 tokens/segundo en una RTX 5090.
  • Tiene licencia Apache 2.0, con pesos en Hugging Face, y actualmente hay proveedores terceros que lo alojan gratis.
  • Merece la pena si necesitas agentes de código en dispositivo o trabajo con documentos privados; busca alternativas si dependes de recuerdo factual fino o de OCR en escenarios críticos.

¿Qué es Bonsai 2 27B?

Bonsai 2 27B es el modelo multimodal comprimido insignia de PrismML, creado aplicando cuantización ternaria de extremo a extremo sobre el modelo de lenguaje Qwen3.8 27B.

Mientras que Qwen3.8 27B en precisión completa ocupa 54 GB en FP16 (la versión sin comprimir), Bonsai 2 27B se queda en 5,9 GB solo texto, lo bastante pequeño para una GPU de consumo o un MacBook.

Según PrismML, la compresión usa pesos ternarios limitados a −1, 0 y +1, combinados con escalado por grupos en FP16. En sus cuentas, eso equivale a 1,72 bits efectivos por peso, frente a los 16 bits de la referencia FP16.

El modelo mantiene la ventana de contexto de 262k tokens y la entrada multimodal de texto e imagen de su base.

El dato clave es el porcentaje de retención.

En una batería que PrismML describe como 14 benchmarks en seis categorías de habilidades, evaluada en modo "thinking" con EvalScope y vLLM sobre una H100, Bonsai 2 27B promedia 84,78 frente a 86,32 del FP16, es decir, un 98,2%.

Para un modelo de menos de 2 bits, esa brecha es mucho menor que con una cuantización convencional.

bonsai-2-27b-model-card

Funciones clave de Bonsai 2 27B

Lo que puedes hacer con Bonsai 2 27B se resume en llevar capacidades de clase 27B a entornos donde normalmente un 27B no cabe.

Estas son las funciones que lo definen.

Ejecuta un modelo multimodal de 27B en un portátil

Bonsai 2 27B cabe en 5,9 GB, lo que acerca un modelo de clase 27B al hardware de consumo en lugar de a un centro de datos.

La representación de pocos bits se aplica a todo el modelo de lenguaje, no solo a unas pocas capas, así que la reducción de huella es real, no cosmética.

Para profesionales, esto cambia lo que significa "local".

En lugar de bajar a un 8B para trabajar en dispositivo, puedes ejecutar algo con la capacidad de razonamiento y programación de un 27B y aún te sobra RAM.

La pega es que arquitectónicamente sigue siendo un 27B, así que el hardware muy modesto notará la presión de memoria.

Contexto de 262k tokens para documentos largos

El modelo ofrece una ventana de 262k tokens, suficiente para incluir una base de código completa, un contrato legal extenso o un montón de PDFs de investigación en un único prompt.

Es especialmente útil en setups de RAG donde quieres mantener mucho contexto residente en lugar de fragmentarlo agresivamente.

La comunidad señala una salvedad: algunos usuarios observan degradación del recuerdo y la coherencia en el extremo de la ventana, más allá de unos 200k tokens.

Si te acercas al límite, prueba el recuerdo con tus propios datos antes de usarlo en producción.

Agentes de código y llamadas a herramientas

Bonsai 2 27B está pensado para aguantar en bucles agénticos, donde pequeños errores se acumulan a lo largo de muchos pasos.

PrismML demostró su capacidad para impulsar agentes de código con Cline y ejecutar flujos de uso del ordenador, ambos en una RTX 5090.

Este suele ser el punto débil de la compresión, porque un paso degradado puede descarrilar toda la ejecución del agente.

Bonsai 2 27B marca 90,07 en LiveCodeBench y 74,92 en BFCL v3, cerca de las cifras FP16, lo que hace que el trabajo agéntico en local sea plausible y no solo aspiracional.

Entrada multimodal de texto e imagen

El modelo acepta imágenes junto con texto, cubriendo VQA, comprensión de documentos y OCR.

Esto habilita flujos privados multimodales como depurar desde una captura de pantalla o analizar un documento escaneado sin enviarlo a la nube.

La visión es también donde más se nota el coste de la compresión.

En MMMU-Pro, Bonsai 2 27B obtiene 75,49 frente a 81,73 del modelo FP16, y en OCR Bench v2 baja a 56,88 frente a 60,99.

Para procesos documentales críticos, diagramas complejos o texto de baja resolución, trataría la visión como el eslabón débil y verificaría resultados.

¿Cómo rinde Bonsai 2 27B en los benchmarks?

El titular agregado es 84,78 frente a 86,32 para FP16, pero el agregado oculta lo que importa.

Las implementaciones convencionales sub-4 bits colapsan selectivamente justo en los benchmarks que exigen razonamiento sostenido, y Bonsai 2 27B está diseñado para mantenerlos.

La comparación que traza PrismML es contra una build convencional de 2 bits del mismo modelo base, Qwen3.8-27B IQ2_XXS, que marca 72,59 de media.

Bonsai 2 27B la supera en más de 12 puntos con menos de dos tercios del tamaño, y se queda a 0,4 puntos de una build de 4 bits mucho mayor (UD-Q4_K_XL con 85,18) siendo un tercio de su huella.

Razonamiento y matemáticas

En matemáticas, Bonsai 2 27B es casi indistinguible del modelo de precisión completa.

Consigue 95,83 en AIME26 y 98,80 en MATH-500, frente a 94,58 y 99,80 en FP16.

El contraste con la cuantización convencional es marcado: IQ2_XXS cae a 57,50 en AIME26, un desplome de 37 puntos que unas pruebas ligeras con preguntas fáciles pasarían por alto.

bonsai-2-27b-benchmarksEn conocimiento y razonamiento más amplios, el panorama es más suave.

Bonsai 2 27B marca 89,09 en MMLU-Redux frente a 91,46 en FP16, y reseñas de terceros sitúan la categoría compuesta de conocimiento y razonamiento alrededor de 79,9 frente a 85,6 para FP16.

El recuerdo factual detallado es donde más te cuesta la compresión ternaria.

Programación y flujos agénticos

La programación se mantiene a la par, e incluso en algunos casos supera al modelo base. Bonsai 2 27B marca 95,12 en HumanEval+ y 90,07 en LiveCodeBench, frente a 93,29 y 90,05 en FP16.

La media compuesta en programación, 89,42 frente a 89,07 de FP16, es una pequeña victoria para el modelo comprimido.

En llamadas a herramientas para agentes, BFCL v3 queda en 74,92 frente a 76,74 para FP16, una brecha moderada.

Como referencia, cuando analizamos Qwen3.8-Max, el modelo mucho mayor de 2,4T marcó 86,1 en OSWorld-Verified para uso agéntico del ordenador, así que Bonsai 2 27B no compite con los buques insignia en la nube en capacidad agéntica bruta.

Compite en poder ejecutar el agente en local, sin más.

Seguimiento de instrucciones

El seguimiento de instrucciones es de las pocas categorías donde Bonsai 2 27B supera por poco al modelo de precisión completa.

Logra 91,31 en IFEval frente a 91,50 para FP16, y 74,00 en IFBench prompt-loose frente a 71,00 de FP16.

Benchmark Bonsai 2 27B Qwen3.8 27B FP16 IQ2_XXS (2-bit)
AIME26 95,83 94,58 57,50
MATH-500 98,80 99,80 84,60
LiveCodeBench 90,07 90,05 56,40
HumanEval+ 95,12 93,29 91,46
MMLU-Redux 89,09 91,46 88,93
MMMU-Pro 75,49 81,73 65,19
Media (14) 84,78 86,32 72,59

Rendimiento y eficiencia energética

La velocidad forma parte de la historia porque determina si los bucles agénticos en local son usables.

Bonsai 2 27B llega hasta 143 tokens/segundo en una NVIDIA GeForce RTX 5090 y 46,8 tokens/segundo en un M5 Max.

En energía, PrismML reporta 0,581 mWh por token en una RTX 4090, lo que afirma que es un 40% más eficiente que un modelo 8B en precisión completa.

Para asistentes de código, mayor rendimiento significa bucles editar-depurar más rápidos; para asistentes en segundo plano en un portátil, menos energía por token implica más batería sin llamar constantemente a la nube.

Precio y disponibilidad de Bonsai 2 27B

Bonsai 2 27B se publica bajo licencia Apache 2.0, así que los pesos se pueden descargar gratis y usar comercialmente.

PrismML lo posiciona ante todo para autohospedaje, y su documentación oficial se centra en el servicio local más que en una API por token.

Los pesos están disponibles hoy en Hugging Face en la colección Bonsai 2.

Las builds en GGUF quedan alrededor de 5,93 a 5,95 GB para la variante ternaria PTQ1_0, con una build MLX que corre más grande. Ten en cuenta que Ternary Bonsai 2 es solo 27B, sin compañeros 8B, 4B o 1,7B en esta generación.

Cómo acceder a Bonsai 2 27B

Bonsai 2 27B es open-weight bajo Apache 2.0, así que lo ejecutas tú mismo en lugar de llamar a una API propietaria.

Funciona en GPUs NVIDIA vía CUDA y en dispositivos Apple (Mac, iPhone, iPad) vía MLX, usando kernels de pocos bits personalizados de PrismML.

Las vías principales son:

  • Autohospedar con el fork de llama.cpp de PrismML: descarga los pesos GGUF desde la colección de Hugging Face y sírvelos; la base del API local por defecto es http://localhost:8080/v1.
  • Autohospedar en Apple Silicon con MLX: sirve la build MLX con base de API local en http://localhost:8081/v1; recuerda que los Macs antiguos pueden toparse con límites de RAM ya que la variante MLX es mayor que la GGUF.
  • Inferencia alojada: accede a través de Together AI como Prism-ML/Ternary-Bonsai-27B o a través de Puter, ambos actualmente gratis.

PrismML expone una interfaz REST al estilo OpenAI, por lo que encaja en herramientas que esperan un endpoint de chat-completions.

Para una guía local completa del primer modelo, consulta nuestra guía general de instalación local de Bonsai.

Reflexiones finales

Bonsai 2 27B apuesta por que la frontera interesante es la inteligencia por gigabyte, no la capacidad bruta.

Cerrar la brecha de retención del 95% de la primera generación a más del 98% hace que el encuadre de "casi sin pérdidas" sea creíble y no marketing, y la gráfica de densidad lo sitúa muy por delante de builds convencionales de pocos bits sobre la misma base.

Lo elegiría si estás creando agentes de código en dispositivo, análisis privado de documentos o sistemas híbridos que mantengan el trabajo sensible en local.

Sería más cauto en QA intensiva en conocimiento y OCR crítico, donde el coste de la compresión es real y medible.

FAQs

¿Cómo se compara Bonsai 2 27B con Qwen3.8 27B?

Bonsai 2 27B es una versión de Qwen3.8 27B comprimida con ternarización. Mantiene el 98,2% de la puntuación agregada del modelo en precisión completa (84,78 frente a 86,32 en una batería de 14 benchmarks en modo thinking) mientras reduce la huella de 54 GB a 5,9 GB, más de 9 veces más pequeño. Matemáticas y programación se mantienen a la par; conocimiento y visión son los que más caen.

¿Bonsai 2 27B es gratuito?

Sí. Bonsai 2 27B se publica bajo licencia Apache 2.0, por lo que los pesos se pueden descargar gratis y usar comercialmente. Proveedores terceros como Together AI y Puter actualmente lo alojan a $0 por 1M de tokens de entrada y salida, aunque ese precio puede ser promocional y PrismML no publica una tarifa oficial por token.

¿Qué hardware necesito para ejecutar Bonsai 2 27B?

Bonsai 2 27B cabe en una huella GGUF de 5,9 GB y se ejecuta en GPUs NVIDIA vía CUDA y en dispositivos Apple (Mac, iPhone, iPad) vía MLX. Alcanza hasta 143 tokens/segundo en una RTX 5090 y 46,8 tokens/segundo en un M5 Max. Arquitectónicamente sigue siendo un 27B, así que el hardware muy básico y Macs antiguos que ejecuten la build MLX más grande pueden toparse con límites de memoria.

¿Cuáles son las debilidades de Bonsai 2 27B?

El coste de la compresión se concentra en conocimiento y visión. El compuesto de conocimiento y razonamiento baja a ~79,9 desde 85,6 en FP16, visión a ~66,2 desde 71,4, y OCR Bench v2 a 56,88 desde 60,99. La comunidad también señala degradación del recuerdo más allá de ~200k tokens y la necesidad de retocar prompts al pasar desde bases Qwen FP16.

¿Para qué casos de uso es mejor Bonsai 2 27B?

Bonsai 2 27B encaja en agentes de código en dispositivo, análisis privado de documentos, flujos de uso del ordenador y configuraciones híbridas donde los modelos locales gestionan tareas sensibles o frecuentes y escalan a la nube selectivamente. Sus puntuaciones en programación, matemáticas y seguimiento de instrucciones se mantienen cerca de la precisión completa, lo que hace viables los bucles agénticos en local. Es menos adecuado para QA intensiva en conocimiento y OCR crítico.


Matt Crabtree's photo
Author
Matt Crabtree
LinkedIn

Escritora y editora de contenidos en el ámbito de la tecnología educativa. Comprometido con la exploración de tendencias de datos y entusiasmado con el aprendizaje de la ciencia de datos.

Temas
Inteligencia Artificial
Grandes modelos lingüísticos

Cursos destacados de DataCamp

Curso

Programación asistida por IA para desarrolladores

1 h 30 min
10.2K
Mejora tu programación con IA: guía a tu asistente de programación para escribir, probar y documentar código de forma eficaz.
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow
Relacionado
An AI juggles tasks

blog

Cinco proyectos que puedes crear con modelos de IA generativa (con ejemplos)

Aprende a utilizar modelos de IA generativa para crear un editor de imágenes, un chatbot similar a ChatGPT con pocos recursos y una aplicación clasificadora de aprobación de préstamos y a automatizar interacciones PDF y un asistente de voz con GPT.
Abid Ali Awan's photo

Abid Ali Awan

10 min

blog

7 emocionantes proyectos de IA para todos los niveles en 2026

Desarrolla tu portafolio y mejora tus habilidades en la creación de soluciones innovadoras para problemas complejos trabajando en proyectos de IA.
Abid Ali Awan's photo

Abid Ali Awan

8 min

An avian AI exits its cage

blog

12 alternativas de código abierto a GPT-4

Alternativas de código abierto a GPT-4 que pueden ofrecer un rendimiento similar y requieren menos recursos informáticos para funcionar. Estos proyectos vienen con instrucciones, fuentes de código, pesos del modelo, conjuntos de datos e IU de chatbot.
Abid Ali Awan's photo

Abid Ali Awan

9 min

Tutorial

Cómo ajustar GPT 3.5: Liberar todo el potencial de la IA

Explore GPT-3.5 Turbo y descubra el potencial transformador del ajuste fino. Aprenda a personalizar este modelo de lenguaje avanzado para aplicaciones especializadas, mejore su rendimiento y comprenda los costes asociados, la seguridad y las consideraciones de privacidad.
Moez Ali's photo

Moez Ali

11 min

Tutorial

IA explicable - Comprender y confiar en los modelos de aprendizaje automático

Sumérjase en la IA explicable (XAI) y aprenda a generar confianza en los sistemas de IA con LIME y SHAP para la interpretabilidad de modelos. Comprender la importancia de la transparencia y la equidad en las decisiones basadas en la IA.
Zoumana Keita 's photo

Zoumana Keita

12 min

Tutorial

DCLM-7B de Apple: Configuración, Ejemplo de uso, Ajuste fino

Empieza a utilizar el gran modelo de lenguaje DCLM-7B de Apple y aprende a configurarlo, utilizarlo y ajustarlo para tareas específicas.
Dimitri Didmanidze's photo

Dimitri Didmanidze

9 min

Ver MásVer Más