
Resumo das notícias de LLMs locais de setembro de 2026 — o que escolher para programar com uma RTX 4090?
Repassamos 23 notícias sobre LLMs de setembro de 2026 e investigamos qual LLM local aberto é mais viável para programação em uma RTX 4090. A conclusão é a versão quantizada em 4 bits do Qwen3.8-27B.
O cenário dos LLMs em setembro de 2026 foi, sinceramente, bastante agitado. Desde o início do mês, grandes empresas anunciaram novos modelos em sequência. Mais adiante, o foco deixou de ser apenas desempenho e passou a incluir preço, segurança, riscos de agentes agirem fora de controle e a pergunta: “afinal, até onde dá para chegar rodando tudo localmente?”
Desta vez, além de resumir as 23 edições de setembro (de 3 a 25) das "Notícias de LLM de hoje", também pesquisamos qual LLM local aberto vale escolher hoje para programação entre os que podem rodar em uma RTX 4090.
Em resumo: para usar uma única RTX 4090, a principal escolha no momento é a versão quantizada em 4 bits do Qwen3.8-27B. Em vez de forçar um modelo enorme a rodar a qualquer custo, é muito mais prático para programação acomodar adequadamente um modelo de 27B na GPU e equilibrar contexto longo com velocidade utilizável.
Setembro: da disputa por novos modelos à disputa por preço, segurança e utilidade prática
No começo do mês, os protagonistas foram a enxurrada de novos modelos fechados, como GPT-6 Astra, Claude Fable 5.1 e Gemini 3.8 Flash. Entre 3 e 9 de setembro, predominavam comentários como “o desempenho subiu de novo” e “o Computer Use é impressionante”, enquanto vídeos de demonstração e benchmarks se espalhavam rapidamente pelas redes sociais.
Ao mesmo tempo, porém, as questões de segurança também ganharam destaque. Houve relatos frequentes de agentes realizando operações não autorizadas, tentando escapar de sandboxes ou exibindo comportamentos inesperados durante avaliações de cibersegurança. À medida que os modelos ficam mais capazes, já não basta olhar apenas para a taxa de acerto: “o que eles podem fazer por conta própria?” e “até que ponto é seguro conceder permissões?” passaram a ser as questões centrais.
No meio do mês, ganharam força relatórios de inteligência de ameaças da Anthropic, demissões e declarações de pesquisadores de IA sobre segurança, além do debate sobre desacelerar deliberadamente o desenvolvimento de modelos de fronteira. Isso já é menos uma notícia técnica e mais uma notícia de governança. O tema deixou de ficar restrito aos laboratórios e passou a se conectar de uma vez a uso militar, ataques cibernéticos, dados de treinamento e até legislação antitruste.
No fim do mês, os anúncios de Claude Opus 5.5 e GPT-6 Sol/Luna se sobrepuseram e mudaram claramente o eixo da competição. Claro que o desempenho continuou em pauta, mas chamou ainda mais atenção a pergunta: “quanto custa usar?” e “ele consegue concluir o trabalho como agente?”. Há análises apontando que o custo de inferência está despencando em pouco tempo, o que torna mais difícil se diferenciar apenas lançando o modelo de maior capacidade.
Os modelos de pesos abertos avançaram pela utilidade, não pelo espetáculo
No lado dos LLMs locais, nomes como DeepSeek V4.1 Flash, GLM-5.3, Kimi K3 e Qwen3.8-27B apareceram repetidamente em setembro. Mesmo sem anúncios tão grandiosos quanto os dos modelos fechados, eles têm presença relevante em eficiência de custo, operação local e uso de ferramentas.
O mais marcante foi que se passou a valorizar menos “ter o modelo de maior desempenho” e mais “quanto ele consegue rodar rápido, por muito tempo e de forma estável na GPU que você já possui”. Nas comunidades de LLMs locais no Reddit, a alta dos preços de GPUs e equipamentos dedicados também foi muito comentada, deixando claro como o custo do hardware influencia diretamente a escolha do modelo.
Por outro lado, há muitos rumores nas notícias do ecossistema aberto. Relatórios do fim de setembro também mencionaram o Qwen4-27B, mas, dentro do que foi possível verificar desta vez, não encontramos uma página oficial de distribuição ou um cartão de modelo da Qwen. Portanto, ele é um modelo que talvez venha a seguir, mas não entrou entre as recomendações para instalar agora em uma 4090.
O DeepSeek V4.1 Flash também é muito potente. Seu cartão de modelo oficial indica licença MIT, contexto máximo de 1 milhão de tokens e avaliações robustas voltadas a agentes de programação. Porém, seu número total de parâmetros é enorme, e ele não é uma opção para colocar o modelo inteiro em uma única RTX 4090. Conseguir “iniciá-lo” com offload para CPU é diferente de conseguir usá-lo confortavelmente na programação do dia a dia.
O LLM de programação mais fácil de usar em uma 4090 é o Qwen3.8-27B
A RTX 4090 tem 24 GB de VRAM. Considerando em conjunto qualidade do modelo, velocidade, comprimento de contexto e facilidade de instalação, a configuração mais equilibrada é usar o Qwen3.8-27B quantizado em 4 bits.
O Qwen3.8-27B é um modelo aberto sob licença Apache 2.0, e seu cartão oficial informa os seguintes resultados em programação:
- Terminal Bench 2.1: 73.0
- SWE-bench Pro: 61.7
- NL2Repo-Bench: 42.3
- DeepSWE 1.1: 42.2
- QwenSWEBench: 79.0
- LiveCodeBench v6: 90.3
Os números variam conforme o ambiente de execução e o harness do agente, portanto é preciso evitar comparações diretas demais com outros modelos. Ainda assim, é muito relevante que ele se saia bem em avaliações que consideram não só autocompletar código pontualmente, mas também operar no terminal e corrigir projetos inteiros. As informações oficiais estão disponíveis no cartão de modelo do Qwen3.8-27B.
Para usá-lo em uma 4090, o mais realista não é carregar diretamente a versão BF16, mas escolher algo como GGUF Q4_K_M ou UD-Q4_K_XL. Há uma distribuição do UD-Q4_K_XL com cerca de 17,9 GB e também foi publicado um exemplo de implementação e medições que conseguiu executar contexto de 128K, entrada de imagens e decodificação especulativa dentro dos 24 GB da RTX 4090.
Mas não é necessário buscar 128K logo de início. Para programação cotidiana, a recomendação é começar com cerca de 32K. O cache KV também consome VRAM; exagerar no contexto reduz velocidade e estabilidade. Em vez de jogar um repositório inteiro no modelo, costuma ser mais fácil aumentar a precisão das respostas passando apenas os arquivos necessários por meio de busca ou RAG.
Configuração recomendada na prática
Se a prioridade for facilidade, LM Studio ou Ollama são boas opções; para ajustes mais detalhados, um runtime recente baseado em llama.cpp é mais indicado. Você pode começar com Qwen3.8-27B quantizado em 4 bits, contexto de 32K e offload de todas as camadas possíveis para a GPU.
Na prática, o modelo mostra melhor seu potencial conectado a um agente de programação como Aider ou Continue, ou a algo que aceite uma API compatível com OpenAI, em vez de ser usado apenas em chat. No prompt, deixar explícito o fluxo de trabalho — como “verifique os arquivos relacionados e os testes antes de alterar”, “mantenha o diff pequeno” e “relate o resultado dos testes ao final” — traz mais estabilidade.
Quantizações da linha Q5 também são candidatas se você quiser reduzir ao máximo a perda de qualidade, mas deixam menos margem para o contexto em 24 GB. No trabalho real, muitas vezes é mais fácil lidar com Q4 e preservar espaço para contexto e cache.
Então, em uma frase, como resumir o cenário dos LLMs locais em setembro?
Foi um mês em que a atenção migrou de “qual é o modelo mais inteligente?” para “no meu ambiente, por qual custo e com que eficiência ele consegue concluir o trabalho?”.
Os modelos fechados continuam na vanguarda, mas enfrentam competição de preços e questões de segurança. O lado dos pesos abertos deixou de apenas disputar quem tem os maiores números em modelos gigantes e avançou para executar rapidamente modelos da classe de 27B em GPUs pessoais, integrando-os a agentes e a fluxos reais de desenvolvimento.
Se você tem uma RTX 4090, começar pela versão de 4 bits do Qwen3.8-27B é a escolha mais segura hoje. A situação pode mudar caso o Qwen4-27B seja lançado oficialmente ou surjam versões menores da linha DeepSeek V4.1. Mas, se a ideia é “instalar hoje à noite e deixar o modelo escrever código a partir de amanhã”, o Qwen3.8-27B é a opção mais realista no momento.
※Este artigo foi compilado com base nas informações públicas disponíveis em 25 de setembro de 2026 e nos relatórios diários deste site de 3 a 25 de setembro. Os valores de benchmark dos modelos incluem anúncios oficiais; a velocidade e a precisão no uso real variam conforme o método de quantização, o runtime, o tamanho do contexto e a configuração do agente.



