[go: up one dir, main page]

Pular para o conteúdo principal

Bonsai 2 27B: rode uma IA de 27B localmente no seu laptop

O Bonsai 2 27B da PrismML compacta um modelo multimodal de 27B para 5,9 GB mantendo 98,2% do desempenho em precisão total — e roda em um laptop.
Atualizado 23 de set. de 2026  · 9 min lido

Explorar com IA

ChatGPTClaudePerplexity

A maioria dos lançamentos de modelos que cobri este ano persegue o mesmo objetivo: ampliar a janela de contexto, subir o score no SWE-bench, adicionar mais um trilhão de parâmetros.

A PrismML está indo na direção oposta.

Em 17 de setembro de 2026, a equipe lançou o Ternary Bonsai 2 27B, uma versão compactada do Qwen3.8 27B que cabe em 5,9 GB e roda em um laptop.

Ao comprimir agressivamente como armazena informações, a PrismML deixou o Bonsai 2 27B mais de 9 vezes menor que a versão original do Qwen. Ainda assim, ele mantém 98,2% do desempenho original e a janela de contexto de 262 mil tokens, processando texto e imagens.

Neste artigo, vou cobrir tudo o que há de novo no Bonsai 2 27B, passando pelos recursos, benchmarks e detalhando preços e acesso.

Se você quiser rodar o primeiro modelo Bonsai por conta própria, temos um passo a passo no nosso tutorial de setup local do Bonsai 27B.

Resumo

  • O Bonsai 2 27B comprime o Qwen3.8 27B para 5,9 GB mantendo 98,2% do desempenho agregado em benchmarks.
  • O ponto-chave é onde a capacidade se mantém: matemática e código ficam no mesmo nível, enquanto conhecimento e visão sofrem mais.
  • Roda localmente em GPUs NVIDIA via CUDA e em dispositivos Apple via MLX, chegando a 143 tokens/segundo em uma RTX 5090.
  • Tem licença Apache 2.0, pesos no Hugging Face, e provedores de terceiros atualmente hospedam de graça.
  • Vale a pena se você precisa de agentes de código on-device ou trabalho privado com documentos; procure outras opções se depende de recuperação de conhecimento muito detalhada ou OCR crítico.

O que é o Bonsai 2 27B?

O Bonsai 2 27B é o modelo multimodal compactado de destaque da PrismML, construído aplicando quantização ternária de ponta a ponta no modelo de linguagem do Qwen3.8 27B.

Enquanto o Qwen3.8 27B em precisão total ocupa 54 GB em FP16 (a versão sem compressão, em tamanho completo), o Bonsai 2 27B fica em 5,9 GB apenas para texto, um tamanho pequeno o bastante para caber em uma GPU de consumo ou em um MacBook.

Segundo a PrismML, a compressão usa pesos ternários limitados a −1, 0 e +1, combinados com escalonamento em grupos em FP16. Isso resulta em 1,72 bits reais por peso na contabilidade da própria PrismML, contra 16 bits da referência FP16.

O modelo mantém a janela de contexto de 262 mil tokens e a entrada multimodal de texto e imagem do modelo base.

O número que chama a atenção é a taxa de retenção.

Em uma suíte que a PrismML descreve como 14 benchmarks em seis categorias de habilidades, avaliada em modo de raciocínio com EvalScope e vLLM em uma H100, o Bonsai 2 27B faz média de 84,78 contra 86,32 do baseline FP16, ou 98,2%.

Para um modelo com menos de 2 bits, essa é uma diferença bem menor do que a quantização convencional costuma entregar.

bonsai-2-27b-model-card

Principais recursos do Bonsai 2 27B

O que você pode fazer com o Bonsai 2 27B, no fim das contas, é rodar capacidade de classe 27B em lugares onde um modelo desse porte normalmente não cabe.

Estes são os recursos que definem o modelo.

Rode um modelo multimodal de 27B em um laptop

O Bonsai 2 27B cabe em 5,9 GB, o que coloca um modelo de classe 27B ao alcance de hardware de consumo, e não só de datacenters.

A representação de poucos bits é aplicada em todo o modelo de linguagem, não só em algumas camadas, então a redução de tamanho é real, não cosmética.

Para quem trabalha na prática, isso muda o que "local" significa.

Em vez de descer para um modelo de 8B para rodar on-device, você pode usar algo com a capacidade de raciocínio e de código de um 27B e ainda manter memória sobrando.

O porém é que, arquiteturalmente, ele continua sendo um 27B, então hardwares muito básicos vão sentir a pressão de memória.

Janela de 262 mil tokens para documentos longos

O modelo traz uma janela de contexto de 262 mil tokens, suficiente para comportar uma base de código inteira, um contrato jurídico extenso ou um conjunto de PDFs de pesquisa em um único prompt.

Isso importa mais em setups de RAG, quando você quer manter grandes volumes de contexto residentes em vez de fragmentar agressivamente.

Relatos da comunidade apontam uma ressalva: alguns usuários notam queda de recuperação e coerência no limite superior da janela, passando de cerca de 200 mil tokens.

Se você estiver próximo do limite, teste a recuperação nos seus dados antes de levar para produção.

Agentes de código e chamadas de ferramentas

O Bonsai 2 27B foi projetado para aguentar loops agentivos, onde pequenos erros se acumulam ao longo de muitos passos.

A PrismML demonstrou sua capacidade de conduzir agentes de código via Cline e executar fluxos de uso de computador, ambos em uma RTX 5090.

Essa é a área em que a compressão geralmente desanda, porque um único passo degradado pode descarrilar toda a execução do agente.

O Bonsai 2 27B marca 90,07 no LiveCodeBench e 74,92 no BFCL v3, próximo dos números FP16, o que torna o trabalho com agentes locais plausível, não só aspiracional.

Entrada multimodal de texto e imagem

O modelo aceita imagens junto com texto, cobrindo VQA, entendimento de documentos e OCR.

Isso abre fluxos multimodais privados, como depurar a partir de um print ou analisar um documento escaneado sem enviar nada para a nuvem.

Visão também é onde o custo da compressão aparece com mais clareza.

No MMMU-Pro, o Bonsai 2 27B marca 75,49 contra 81,73 do modelo FP16, e no OCR Bench v2 cai para 56,88 contra 60,99.

Para processamento de documentos de alto risco, diagramas complexos ou texto em baixa resolução, trate visão como o elo mais fraco e valide os resultados.

Como o Bonsai 2 27B se sai nos benchmarks?

O agregado conta a história de 84,78 versus 86,32 do FP16, mas o agregado esconde o que mais importa.

Builds convencionais abaixo de 4 bits desabam seletivamente justamente nos benchmarks que exigem raciocínio sustentado, e o Bonsai 2 27B foi projetado para segurar esses casos.

A comparação que a PrismML traça é contra um build convencional de 2 bits do mesmo modelo base, o Qwen3.8-27B IQ2_XXS, que faz 72,59 no agregado.

O Bonsai 2 27B supera esse número em mais de 12 pontos com menos de dois terços do tamanho, e fica a 0,4 ponto de um build de 4 bits bem maior (UD-Q4_K_XL com 85,18), sendo um terço do seu tamanho.

Raciocínio e matemática

Em matemática, o Bonsai 2 27B é quase indistinguível do modelo em precisão total.

Ele marca 95,83 no AIME26 e 98,80 no MATH-500, contra 94,58 e 99,80 do FP16.

O contraste com a quantização convencional é gritante: o IQ2_XXS cai para 57,50 no AIME26, um tombo de 37 pontos que testes casuais com questões fáceis não captariam.

bonsai-2-27b-benchmarksEm conhecimento geral e raciocínio amplo, o cenário é mais suave.

O Bonsai 2 27B faz 89,09 no MMLU-Redux contra 91,46 do FP16, e análises de terceiros colocam a categoria composta de conhecimento e raciocínio por volta de 79,9 versus 85,6 do FP16.

A recuperação de fatos muito específicos é onde a compressão ternária mais cobra seu preço.

Códigos e fluxos agentivos

Em código, o desempenho se mantém e, em alguns pontos, supera o modelo base. O Bonsai 2 27B marca 95,12 no HumanEval+ e 90,07 no LiveCodeBench, contra 93,29 e 90,05 do FP16.

A média composta de código em 89,42 versus 89,07 do FP16 é uma pequena vantagem para o modelo compactado.

Em chamadas de ferramentas agentivas, o BFCL v3 fica em 74,92 contra 76,74 do FP16, uma diferença modesta.

Para comparação, quando analisamos o Qwen3.8-Max, o modelo bem maior de 2,4T marcou 86,1 no OSWorld-Verified para uso agentivo de computador, então o Bonsai 2 27B não compete com os flagships na nuvem em capacidade bruta de agente.

Ele compete por conseguir rodar o agente localmente.

Seguimento de instruções

Seguimento de instruções é uma das poucas categorias em que o Bonsai 2 27B encosta ou supera o modelo em precisão total.

Ele marca 91,31 no IFEval versus 91,50 do FP16, e 74,00 no IFBench prompt-loose contra 71,00 do FP16.

Benchmark Bonsai 2 27B Qwen3.8 27B FP16 IQ2_XXS (2-bit)
AIME26 95,83 94,58 57,50
MATH-500 98,80 99,80 84,60
LiveCodeBench 90,07 90,05 56,40
HumanEval+ 95,12 93,29 91,46
MMLU-Redux 89,09 91,46 88,93
MMMU-Pro 75,49 81,73 65,19
Média (14) 84,78 86,32 72,59

Throughput e eficiência energética

Velocidade faz parte da história aqui porque determina se loops agentivos locais são utilizáveis.

O Bonsai 2 27B chega a 143 tokens/segundo em uma NVIDIA GeForce RTX 5090 e 46,8 tokens/segundo em um M5 Max.

Em energia, a PrismML reporta 0,581 mWh por token em uma RTX 4090, o que, segundo a empresa, é 40% mais eficiente que um modelo de 8B rodando em precisão total.

Para assistentes de código, maior throughput significa ciclos de edição e depuração mais rápidos; para assistentes em segundo plano no laptop, menos energia por token significa mais bateria sem depender o tempo todo da nuvem.

Preço e disponibilidade do Bonsai 2 27B

O Bonsai 2 27B é lançado sob a licença Apache 2.0, então os pesos são gratuitos para download e uso comercial.

A PrismML o posiciona principalmente para auto-hospedagem, e a documentação oficial foca em servir localmente, não em API por token.

Os pesos estão disponíveis hoje no Hugging Face na coleção Bonsai 2.

Builds em GGUF ficam por volta de 5,93 a 5,95 GB para a variante ternária PTQ1_0, com um build em MLX que roda maior. Observe que o Ternary Bonsai 2 é apenas 27B, sem versões 8B, 4B ou 1,7B nesta geração.

Como acessar o Bonsai 2 27B

O Bonsai 2 27B tem pesos abertos sob a Apache 2.0, então você roda por conta própria em vez de chamar uma API proprietária.

Ele roda em GPUs NVIDIA via CUDA e em dispositivos Apple (Mac, iPhone, iPad) via MLX, usando kernels de poucos bits personalizados da PrismML.

Os caminhos principais são:

  • Auto-hospedar com o fork do llama.cpp da PrismML: baixe os pesos em GGUF da coleção no Hugging Face e sirva localmente; a base padrão da API local é http://localhost:8080/v1.
  • Auto-hospedar no Apple Silicon com MLX: sirva o build em MLX com base de API local em http://localhost:8081/v1, lembrando que Macs mais antigos podem bater no limite de RAM, já que a variante MLX é maior que a GGUF.
  • Inferência hospedada: acesse via Together AI como Prism-ML/Ternary-Bonsai-27B ou via Puter, ambos atualmente gratuitos.

A PrismML expõe uma interface REST no estilo OpenAI, então ela se encaixa em ferramentas que esperam um endpoint de chat-completions.

Para um passo a passo completo do primeiro modelo, veja nosso guia geral de setup local do Bonsai.

Considerações finais

O Bonsai 2 27B aposta que a fronteira interessante é inteligência por gigabyte, não capacidade bruta.

Fechar a lacuna de retenção de 95% na primeira geração para mais de 98% é o que torna a ideia de "quase sem perdas" crível, e o gráfico de densidade o coloca bem à frente de builds convencionais de poucos bits do mesmo base.

Eu apostaria nele se você estiver criando agentes de código on-device, análise privada de documentos ou sistemas híbridos que mantêm o trabalho sensível local.

Eu seria mais cauteloso para QA pesado em conhecimento e OCR crítico, onde o custo da compressão é real e mensurável.

FAQs

Como o Bonsai 2 27B se compara ao Qwen3.8 27B?

O Bonsai 2 27B é uma versão com compressão ternária do Qwen3.8 27B. Ele mantém 98,2% da pontuação agregada do modelo em precisão total (84,78 versus 86,32 em uma suíte de 14 benchmarks em modo de raciocínio) enquanto reduz o tamanho de 54 GB para 5,9 GB, mais de 9x menor. Matemática e código ficam no mesmo nível, enquanto conhecimento e visão sofrem a maior queda.

O Bonsai 2 27B é gratuito para usar?

Sim. O Bonsai 2 27B é lançado sob a licença Apache 2.0, então os pesos são gratuitos para baixar e usar comercialmente. Provedores de terceiros, como Together AI e Puter, atualmente hospedam o modelo a US$ 0 por 1M de tokens de entrada e saída, embora isso possa ser promocional e a PrismML não publique uma tarifa oficial por token.

Que hardware eu preciso para rodar o Bonsai 2 27B?

O Bonsai 2 27B cabe em um arquivo GGUF de 5,9 GB e roda em GPUs NVIDIA via CUDA e em dispositivos Apple (Mac, iPhone, iPad) via MLX. Ele chega a 143 tokens/segundo em uma RTX 5090 e 46,8 tokens/segundo em um M5 Max. Ainda é um modelo de 27B, do ponto de vista arquitetural, então hardwares muito básicos e Macs antigos rodando o build maior em MLX podem esbarrar em limites de memória.

Quais são as fraquezas do Bonsai 2 27B?

O custo da compressão se concentra em conhecimento e visão. A categoria composta de conhecimento e raciocínio cai para cerca de 79,9 ante 85,6 do FP16; visão para cerca de 66,2 ante 71,4; e o OCR Bench v2 para 56,88 ante 60,99. Relatos da comunidade também apontam degradação de recuperação passando de ~200 mil tokens e a necessidade de readequar prompts ao migrar dos baselines Qwen em FP16.

Quais são os melhores casos de uso para o Bonsai 2 27B?

O Bonsai 2 27B é ideal para agentes de código on-device, análise privada de documentos, fluxos de uso de computador e setups híbridos em que modelos locais lidam com tarefas sensíveis ou frequentes e escalam para a nuvem seletivamente. Suas pontuações em código, matemática e seguimento de instruções ficam próximas da precisão total, o que viabiliza loops agentivos locais. Ele é menos indicado para QA pesado em conhecimento e OCR crítico.


Matt Crabtree's photo
Author
Matt Crabtree
LinkedIn

Escritor e editor de conteúdo na área de edtech. Comprometido com a exploração de tendências de dados e entusiasmado com o aprendizado da ciência de dados.

Tópicos
Inteligência Artificial
Modelos de idiomas grandes

Principais cursos da DataCamp

Curso

Codificação com IA para Desenvolvedores

1 h 30 min
10.2K
Melhore sua programação com IA — guie seu assistente de programação para escrever, testar e documentar códigos de forma eficaz.
Ver detalhesRight Arrow
Iniciar Curso
Ver maisRight Arrow
Relacionado

blog

O que é o Mistral Large 2? Como funciona, casos de uso e muito mais

O Mistral Large 2 é o modelo de idioma mais recente da Mistral AI, competindo com modelos como GPT-4o, Llama 3.1 e Claude 3 Opus.
Ryan Ong's photo

Ryan Ong

8 min

blog

Os 7 melhores geradores de vídeo com IA para 2026, com vídeos de exemplo

Conheça os melhores geradores de vídeo com IA disponíveis hoje, incluindo RunwayML, Synthesia, Colossyan, Pictory, DeepBrain AI, Invideo e os super esperados Sora e Veo da DeepMind.
Dr Ana Rojo-Echeburúa's photo

Dr Ana Rojo-Echeburúa

9 min

Tutorial

DCLM-7B da Apple: Configuração, exemplo de uso, ajuste fino

Comece a usar o modelo de linguagem grande DCLM-7B da Apple e saiba como configurá-lo, usá-lo e ajustá-lo para tarefas específicas.
Dimitri Didmanidze's photo

Dimitri Didmanidze

9 min

Tutorial

Como fazer o ajuste fino do GPT 3.5: Liberando todo o potencial da IA

Explore o GPT-3.5 Turbo e descubra o potencial transformador do ajuste fino. Saiba como personalizar esse modelo de linguagem avançado para aplicativos de nicho, aprimorar seu desempenho e entender os custos associados, a segurança e as considerações de privacidade.
Moez Ali's photo

Moez Ali

11 min

Tutorial

Guia de Introdução ao Ajuste Fino de LLMs

O ajuste fino dos grandes modelos de linguagem (LLMs, Large Language Models) revolucionou o processamento de linguagem natural (PLN), oferecendo recursos sem precedentes em tarefas como tradução de idiomas, análise de sentimentos e geração de textos. Essa abordagem transformadora aproveita modelos pré-treinados como o GPT-2, aprimorando seu desempenho em domínios específicos pelo processo de ajuste fino.
Josep Ferrer's photo

Josep Ferrer

11 min

cursor ai code editor

Tutorial

AI do cursor: Um guia com 10 exemplos práticos

Saiba como instalar o Cursor AI no Windows, macOS e Linux e descubra como usá-lo em 10 casos de uso diferentes.
Ver MaisVer Mais