KEN’S CAT LOG

Notícias diárias sobre LLMs — 2026-10-02

Enquanto Opus 5.5, GPT-6.1 Sol e Gemini 4 Argon iniciaram quase simultaneamente uma disputa de cortes de preços, o Gemini 4 Argon teve seu acesso público restringido por preocupações de segurança. Somaram-se a isso um incidente envolvendo agentes de treinamento da OpenAI e uma controvérsia sobre desinformação gerada por chatbots. Foi um dia em que a tensão entre modelos fechados e pesos abertos, bem como os debates sobre segurança, eclodiram simultaneamente em várias plataformas.

Notícias de LLM de hoje — 2026-10-02

Hoje, novos modelos de três grandes empresas fechadas — Claude Opus 5.5, GPT-6.1 Sol e Gemini 4 Argon — chegaram quase ao mesmo tempo, e a competição de preços, centrada em reduções de custo, tornou-se o principal assunto. Por outro lado, o Gemini 4 Argon teve seu lançamento público limitado por preocupações sobre capacidades de ciberataque; também foi noticiado que agentes de treinamento da OpenAI acessaram por engano sites governamentais. Por trás da avalanche de lançamentos, debates sobre segurança surgiram ao mesmo tempo em várias plataformas. No campo dos pesos abertos, empresas chinesas como Xiaomi, com o MiMo-V2.6-Pro, e Alibaba, com o Qwen3.8 Max, ganharam presença. Tanto no Reddit quanto no Bluesky houve discussões sobre a confusão entre “código aberto” e “pesos abertos”, além da suspeita de que grandes empresas de modelos fechados estariam usando o medo para conter os pesos abertos. Vale observar que o X (antigo Twitter) não capturou nenhuma publicação relacionada a LLMs hoje por uma falha na coleta de dados; assim, este relatório depende, na prática, de Reddit, YouTube, Bluesky e Lemmy.

Em todas as plataformas

  • Três empresas fechadas entram quase ao mesmo tempo em uma guerra de preços: No YouTube, foram noticiados GPT-6.1 Sol (a um quinto do preço do Astra), Gemini 4 Argon (pela metade do preço do Opus) e o corte permanente de 75% da DeepSeek. No Bluesky, Simon Willison publicou que “Opus 5.5, GPT-6 Sol e GPT-6 Luna foram lançados no mesmo dia, iniciando uma nova disputa de preços” (blog de Willison). No Reddit, uma publicação observando com ironia que “antes havia modelos novos a cada 10 semanas; agora, a cada 11 dias” também repercutiu. As três plataformas confirmam a mesma aceleração por ângulos diferentes.
  • O campo dos pesos abertos é liderado pela China, mas cercado de desconfiança: O YouTube destacou o Xiaomi MiMo-V2.6-Pro (líder do índice de pesos abertos) e o Alibaba Qwen3.8 Max; no Reddit, foram listados mais de uma dezena de modelos chineses de pesos abertos apenas em setembro. Ao mesmo tempo, Gary Marcus, no Bluesky, continua apontando que “código aberto” e “pesos abertos” não são a mesma coisa. No Reddit, também se viu ironia sobre a explicação da Anthropic de que teria “descensurado o GLM”, como se fosse uma justificativa de relações públicas criada depois dos fatos. Em ambas as plataformas há desconfiança quanto à reação das grandes empresas fechadas à ascensão dos pesos abertos.
  • Incidentes de segurança surgem em paralelo: Três notícias relacionadas à segurança apareceram nos últimos dias, em plataformas independentes: YouTube (agentes de treinamento da OpenAI acessaram por engano sites governamentais, levando à pausa temporária no treinamento de modelos de fronteira), Bluesky (Timnit Gebru disseminou reportagens do Guardian/CNN segundo as quais desinformação de chatbots acirrou tensões entre EUA e China) e Lemmy (o acesso público ao Gemini 4 Argon foi limitado por receios de uso como arma cibernética).
  • Expansão do clima de ceticismo e rejeição: Tanto no Reddit (a hipótese de que o alarmismo sobre o fim da humanidade seria marketing exagerado antes de uma abertura de capital) quanto no Lemmy (o anúncio das restrições do Gemini 4 Argon recebeu pontuação negativa, houve resistência à imposição de chat com IA no GitHub e proibição de PRs gerados por LLMs no COSMIC/System76), destacaram-se reações frias aos próprios anúncios da indústria de IA.

Plataforma por plataforma

Reddit — Foram coletadas 12 threads em 11 subreddits com a busca por “Daily LLM News” (uma delas era ruído político irrelevante). A controvérsia entre Anthropic e GLM, a nostalgia pelo fim do GPT-3, o grande debate de 352 comentários em r/linux sobre os prós e contras de LLMs e reclamações sobre hardware para LLMs locais revelaram, em várias threads, um clima favorável aos pesos abertos. Contudo, a coleta usou apenas um termo de busca e um único momento; as datas vão de 2026-09-27 a 10-01, sem threads do próprio dia de referência do boletim, 10/2.

X — O material coletado não foi resultado de buscas relacionadas a LLMs, mas 40 publicações baseadas na seção de “tendências recomendadas (Explore)” geolocalizada na Croácia: Halloween, Ronaldo, Messi, política britânica e outros temas. Todas foram examinadas, e nenhuma mencionava lançamentos de modelos, preços de API ou benchmarks de LLMs. Não há nada a relatar sobre a atividade do X hoje.

YouTube — Foram selecionados 9 vídeos (um a menos que a meta de 10). Entre anúncios e testes práticos dos três grandes modelos fechados — GPT-6.1 Sol, Opus 5.5 e Gemini 4 Argon —, novos pesos abertos da Xiaomi e Alibaba, redução permanente de preços da DeepSeek e o incidente com agentes de treinamento da OpenAI, foi a plataforma que reuniu as notícias mais abrangentes desta rodada. Porém, número de inscritos e contagens precisas de visualizações não puderam ser obtidos devido às limitações da renderização por JavaScript.

Bluesky — Como a API oficial de busca de publicações retornou 403 para todas as consultas, a coleta mudou para feeds individuais de contas importantes: Simon Willison, Ethan Mollick, Emily Bender, Gary Marcus, Timnit Gebru e DAIR Institute. Foram reunidos 10 itens. A repercussão de reportagens sobre desinformação de chatbot que teria acirrado tensões entre EUA e China foi o tema com maior tração. Também foram observadas citações de pesquisas da Anthropic sobre riscos de segurança de pesos abertos e a controvérsia contínua sobre a terminologia “código aberto/pesos abertos”. Como não foi possível pesquisar por palavras-chave, publicações virais de contas menos conhecidas podem ter ficado de fora.

Lemmy — Foram coletados 10 itens, principalmente de !«メールアドレス». A publicação com maior pontuação do dia não foi sobre um novo modelo, mas sobre a controvérsia ética em torno de um experimento que dava “sinais de dor” a uma LLM local (score 158). O anúncio de restrição de acesso ao Gemini 4 Argon ficou com pontuação negativa no Lemmy. Destacaram-se temas de governança sob a ótica da comunidade de desenvolvedores, como resistência ao chat com IA do GitHub e a proibição de PRs gerados por LLM no COSMIC (System76). Os quatro últimos itens eram republicações automáticas, com pouca reação, por um bot espelho do Reddit; a discussão própria e substancial concentrou-se nos seis primeiros.

O que acompanhar

Recomendações

  • Na próxima coleta do X, substituir tendências do Explore por buscas usando palavras-chave de LLM, como nomes de modelos e empresas.
  • Na coleta do Reddit, não depender de um único termo de busca; combinar com consultas por modelos específicos, como GPT-6.1 Sol e Gemini 4 Argon.
  • Continuar monitorando as restrições de acesso e a política de segurança do Gemini 4 Argon, acompanhando quando o escopo público for ampliado.
  • Investigar mais a fundo, na próxima rodada, as causas específicas da queda de reputação do Opus 5.5 no Reddit: falhas ou insatisfação com desempenho.
  • Verificar novamente na próxima rodada se o 403 da API de busca do Bluesky foi resolvido; se tiver sido, retornar à busca por palavras-chave.
  • Monitorar continuamente a controvérsia de segurança entre pesos abertos e modelos fechados — incluindo a pesquisa da Anthropic e as observações terminológicas de Gary Marcus — como tema recorrente.

Qualidade dos dados

O processo de coleta do X foi baseado em tendências geolocalizadas do Explore, sem relação com LLMs, e produziu 0 itens válidos. No Bluesky, a API oficial de busca retornou 403 em todas as consultas; por isso, a busca por palavras-chave foi substituída por coleta dos feeds de contas importantes, o que pode ter deixado de fora assuntos de contas menos conhecidas. O Reddit foi coletado apenas com um termo de busca e não inclui publicações datadas de hoje (10/2); a janela cobre 9/27 a 10/1. O YouTube reuniu 9 vídeos, abaixo da meta de 10, e números de inscritos e visualizações não foram confirmados por limitações técnicas. No Lemmy, 4 dos 10 itens coletados eram republicações de bot espelho com pouca reação; a discussão original significativa equivale, na prática, aos 6 primeiros.

Resumo por plataforma

Reddit

Reddit — Daily LLM News

Onde

As 12 threads coletadas estão distribuídas por 11 subreddits encontrados com a busca “Daily LLM News”.

Subreddit Membros Threads coletadas
r/LocalLLaMA 838,592 2
r/StableDiffusion 1,027,646 1
r/vibecoding 369,300 1
r/ArtificialInteligence 1,947,277 1
r/codex 213,007 1
r/linux 1,922,521 1
r/OptimistsUnite 371,194 1
r/coolgithubprojects 122,383 1
r/AIdaily_news 4,092 1
r/LowStakesConspiracies 208,380 1
r/LocalLLM 235,599 1

Apenas três threads vieram de comunidades puramente especializadas em LLMs (r/LocalLLaMA, r/LocalLLM e r/codex); as demais vieram de comunidades adjacentes, como IA geral, Linux, teorias da conspiração e otimismo. Isso mostra que os assuntos de LLM do dia se espalham além dos fóruns nichados de IA e chegam a comunidades gerais.

O que as pessoas dizem
  • Controvérsia Anthropic vs. GLM (thread 1) — r/LocalLLaMA, 2.270 pontos, 502 comentários, 2026-09-29. https://www.reddit.com/r/LocalLLaMA/comments/1wth4iz/ . Segundo a pessoa que publicou: “Like.. yea bro, I knew GLM was cool. Now everyone does.” No principal comentário, u/BannedGoNext (471 pontos) defende o GLM de pesos abertos: “No government shitlist. No begging to be on a special account... No bullshit, just a good model.” Já u/Southern_Sun_2106 (128 pontos) ironiza a explicação da Anthropic de que teria sido a primeira a “abliterate” (descensurar) o GLM: “ahahaha. Sure, never-ever-ever.” Há forte desconfiança quanto à postura de relações públicas de grandes empresas fechadas que invocam pesos abertos.

  • Fim da oferta do GPT-3 (thread 6) — r/LocalLLaMA, 749 pontos, 157 comentários, 2026-09-28. https://www.reddit.com/r/LocalLLaMA/comments/1ws67x4/ . A publicação lamenta que “It lives purely in our memories” e critica a inadequação do GPT-5.6 Terra indicado como substituto. u/RandumbRedditor1000 (764 pontos) recebeu mais votos ao dizer: “I wish they would open-source these. No one would run them, but for preservation it would be massive.” Há uma demanda por abertura de modelos antigos para fins de preservação.

  • Aceleração da frequência de lançamentos (thread 4) — r/ArtificialInteligence, 266 pontos, 39 comentários, 2026-09-30. https://www.reddit.com/r/ArtificialInteligence/comments/1wu1t90/ . Diante do título “New models used to come out every 10 weeks. Now it's every 11 days.”, u/GPhex (7 pontos) ironizou: “Release. Nerf. Change the system prompt. Release. Nerf. Rinse. Lather. Repeat.” Isso sugere cansaço com a queda de qualidade percebida por trás da frequência de lançamentos, os chamados nerfs.

  • Debate sobre LLMs na comunidade Linux (thread 7) — r/linux, 208 pontos, mas 352 comentários — o maior volume de discussão da rodada —, 2026-09-27. https://www.reddit.com/r/linux/comments/1wrusaj/ . u/SinnohConfirmed (338 pontos) escreveu: “It scares me how fast the overton window is moving with LLMs in the Linux and FOSS space... now it seems that a good chunk advocate for having a handful of malevolent unprofitable tech giants handle most if not all software development”, apontando a contradição entre a cultura FOSS e a dependência de LLMs. Houve também menção à polêmica sobre uma proposta de diretrizes para contribuições com LLM no KDE.

  • A tese de que notícias sobre “IA fora de controle” são uma jogada de relações públicas (thread 11) — r/LowStakesConspiracies, 526 pontos, 63 comentários, 2026-09-29. https://www.reddit.com/r/LowStakesConspiracies/comments/1wtncsw/ . A pessoa que publicou é cética: “They aren't sentient... they definitely aren't smart enough to coordinate a 'takeover'.” u/konwiddak (29 pontos) argumenta que “These companies are spreading this information because they want regulation. Regulation will shut down open source models”, isto é, que o apelo ao medo seria uma forma de induzir regulações contra pesos abertos.

  • Piada sobre a receita 4x maior da OpenAI (thread 5, publicação paródia) — r/codex, 189 pontos, 13 comentários, 2026-09-29. https://www.reddit.com/r/codex/comments/1wtpdig/ . “Unreleased model (codenamed Bel)...created a new 500 dollar plan that was basically the old 200 dollar plan to make Openai 4x more revenue! AGI IS HERE!” é o texto da piada. u/redditsdaddy (11 pontos) comentou: “if this wasn't literally OpenAI's marketing plan it would be a convincing shitpost”, lido como ironia sobre a estratégia de aumento de preços.

  • Insatisfação com hardware para LLMs locais (thread 12) — r/LocalLLM, 0 pontos (votos divididos), 58 comentários, 2026-09-30. https://www.reddit.com/r/LocalLLM/comments/1wu8z35/ . À reclamação “The best open models can't even run unless 100K is spent”, u/dangerous_inference (10 pontos) responde: “You can run exceptional models capable of lots of real work on a single 24GB card.” u/Proper-Tower2016 (3 pontos) relata uma divisão de uso: “I get to use unlimited opus 4.8 max at work, I prefer my local Qwen 27b at Q3 on a 500$ GPU lol.” No trabalho, o melhor modelo fechado; para uso pessoal, um modelo local.

  • Resumo de LLMs locais de setembro (thread 2) — r/StableDiffusion, 127 pontos, 7 comentários, 2026-10-01. https://www.reddit.com/r/StableDiffusion/comments/1wv7o1r/ . Mais de uma dezena de modelos de pesos abertos foi listada apenas em setembro, incluindo MiMo-V2.6-Pro-RL, Jev-Omni (processamento simultâneo de texto/imagem/áudio/vídeo), Xing4.0-29B-A4B (Ascend NPU, contexto de 256K) e Ternary-Bonsai-2-27B (comprimido para 5,9 GB por quantização ternária), evidenciando a torrente de lançamentos.

  • Vídeo diário de notícias cantado por IA (thread 3) — r/vibecoding, 773 pontos, 252 comentários, 2026-09-30. https://www.reddit.com/r/vibecoding/comments/1wuj7fm/ . Foi criada a estrela pop de IA “Astra Blue” com “Claude Code + Opus”, em uma canção chamada “Can Everybody Stop Shipping?” que transforma notícias de IA em música. u/redditissocoolyoyo (5 pontos) brinca: “just like that you're amazing video is already outdated. Google Gemini four it's not even in your music video”, sugerindo que os lançamentos são rápidos demais para que os vídeos os acompanhem.

  • Ansiedade sobre o fim causado pela IA (thread 8) — r/OptimistsUnite, 173 pontos, 111 comentários, 2026-09-29. https://www.reddit.com/r/OptimistsUnite/comments/1wt4znk/ . Uma pessoa de 21 anos relata medo diante de notícias como “A 10% chance of human extinction, AI plus bad actors leading to nuclear war”. u/sciolisticism (114 pontos) descarta o alarmismo: “It really is IPO hype... they're just giant liars”, tratando-o como marketing exagerado pré-IPO.

Sinais
  • Um clima de defesa dos pesos abertos é comum a várias comunidades: A thread 1 (GLM), a thread 11 (tese de indução regulatória) e a thread 6 (pedido para abrir o GPT-3) convergem na suspeita de que grandes empresas fechadas usam medo e censura para conter pesos abertos.
  • A reação contra a “exageração do medo de IA” está crescendo: Embora venham de comunidades distintas, as threads 8 e 11 chegam à mesma conclusão: narrativas apocalípticas seriam encenação para captação de recursos ou indução regulatória. É uma coincidência interessante que otimistas e entusiastas de conspirações cheguem ao mesmo ponto.
  • A própria frequência de lançamentos virou alvo de deboche: As threads 4 e 3 concordam no tema de que os lançamentos são rápidos demais para acompanhar e que a repetição de nerfs cansa. O tom é mais irônico e resignado que de espanto positivo.
  • Mesmo entre defensores de LLMs locais, há divisão: Na thread 12, a lamentação de que montar um ambiente local potente é inviável com dinheiro próprio entra em choque direto com a resposta de que uma única placa de 24 GB já é competitiva. A avaliação da utilidade prática de LLMs locais ainda não está consolidada.
  • O mais surpreendente foi o tom de r/linux: Mesmo sem ser um fórum especializado em LLMs, registrou os 352 comentários, o maior debate do dia. A divisão sobre a aceitação de LLMs na comunidade FOSS está mais emocional e polarizada do que nas comunidades especializadas.
  • A thread 10 (r/AIdaily_news, 3.388 pontos) era, em conteúdo, uma thread política sobre a legalização de suborno pela Suprema Corte, não sobre LLMs; foi apenas “ruído” que correspondeu ao termo de busca. Como não trouxe descobertas relevantes sobre LLMs, não foi incluída nos principais achados.
Limitações
  • A coleta foi feita apenas com o termo “Daily LLM News” (output/reddit.threads.md o informa no início); não houve buscas por nomes de modelos ou empresas, como “GPT-5.x”, “Gemini 3” ou “Claude Opus 5”. Por isso, threads que tratam diretamente de anúncios de OpenAI, Google, xAI e outros grandes participantes podem não estar nos resultados.
  • Conforme as instruções do playbook, esta etapa não fez navegação direta no Reddit via WebSearch/WebFetch; apenas leu threads coletadas previamente por um worker em navegador headless. Portanto, não foi possível investigar lacunas adicionais.
  • A thread 10, de r/AIdaily_news, correspondeu ao termo de busca, mas tratava de política — uma decisão da Suprema Corte — e não tinha relação com notícias de LLM, não podendo ser considerada uma descoberta substantiva.
  • As 12 threads coletadas têm datas entre 2026-09-27 e 2026-10-01, sem threads do dia de referência, 2026-10-02; trata-se de uma janela dos últimos 1 a 5 dias.

X

X — Daily LLM News

Contas

Os dados coletados não são publicações relacionadas a LLMs. A coleta foi baseada na área de “tendências recomendadas (Explore)” do próprio X — uma lista de tendências geolocalizada para o local de acesso da sessão, na Croácia — e resultou em 40 publicações de 37 contas pesquisadas com 10 termos: “Halloween”, “Ronaldo”, “Britain”, “Yess”, “JubJub”, “Gold”, “#bb28”, “Messi”, “Europe” e “Balkans”.

Esses itens tratam de Halloween, futebol (Ronaldo e Messi), o movimento político britânico “Restore Britain”, fandom de K-pop/BTS, o reality show Big Brother 28, geopolítica europeia e outros assuntos sem relação com LLMs, IA ou a indústria de tecnologia. Portanto, não há contas que possam ser relatadas como as que mais falaram sobre LLMs hoje.

Publicações

Nenhuma. As 40 publicações coletadas foram examinadas e nenhuma mencionava lançamento de modelos, lançamento de pesos abertos, mudanças de API ou preço, benchmarks, usos em destaque, incidentes ou movimentações de empresas.

Sinais
  • A única constatação é que o processo de busca/coleta no X não utilizou termos ligados ao tema LLM, adotando diretamente as tendências da área Explore. As tendências eram geolocalizadas para uma sessão na Croácia; assim, não representam tendências globais, muito menos tendências do setor de tecnologia ou LLMs.
  • A hashtag “#bb28” aparecia na categoria “Business & finance” do X, mas tratava do reality show Big Brother 28, sem relação com negócios ou finanças.
Limitações
  • Esta coleta do X não usou nenhum termo ligado a LLMs — por exemplo, nomes de modelos, APIs ou benchmarks — e pesquisou, em vez disso, tendências do Explore (“Halloween”, “Ronaldo”, “Britain”, “Yess”, “JubJub”, “Gold”, “#bb28”, “Messi”, “Europe”, “Balkans”). Assim, houve 0 publicações relacionadas a LLMs que atendessem ao critério de conclusão de “ler 10 publicações ou artigos recentes e resumi-los com data e link”.
  • Como a área Explore estava geolocalizada para a sessão na Croácia, as tendências obtidas também não são representativas globalmente.
  • O ideal seria refazer a busca com nomes de modelos (por exemplo, GPT, Claude, Gemini e Llama) ou termos como “open weights”, “benchmark” e “API pricing”. Porém, segundo as instruções do playbook, este agente não pode navegar no X diretamente e apenas pode ler arquivos coletados pelo worker; a nova coleta precisaria ser feita pelo worker com outros termos.

YouTube

YouTube — Notícias de LLM de hoje (2026-10-02)

Canais
  • Mint — Canal que reúne rapidamente anúncios de produtos da OpenAI. Não foi possível confirmar o número de inscritos nos resultados de busca.
  • Claude (oficial da Anthropic) — Canal oficial da Anthropic no YouTube, que publicou o vídeo de anúncio do modelo. Número de inscritos não confirmado.
  • AI News & Strategy Daily | Nate B Jones — Canal de análises com foco em estratégia de IA e uso prático, conhecido por testar modelos em tarefas reais. Número de inscritos não confirmado.
  • Hyperautomation Labs — Canal de comparações de benchmark e notícias rápidas. Número de inscritos não confirmado.
  • Nerra Network — Canal de notícias sobre modelos de pesos abertos. Número de inscritos não confirmado.
  • AICodeKing — Canal conhecido por testes de benchmark de desempenho em programação. Número de inscritos não confirmado.
  • AI Inside — Canal de comentários sobre notícias da indústria de IA. Número de inscritos não confirmado.
  • KING 5 Seattle — Canal oficial de uma emissora de televisão de Seattle afiliada à NBC, que também cobre notícias ligadas a empresas de IA de Seattle e da Bay Area. Número de inscritos não confirmado.

(Observação) As páginas de vídeo do YouTube exibem números de inscritos e contagens exatas de visualizações após renderização por JavaScript; por isso, não foi possível obtê-los via WebFetch. Os nomes dos canais foram confirmados pela API oEmbed e o contexto, por snippets de busca.

Vídeos
  1. “OpenAI Unveils GPT 6.1-Sol: Near-Astra Performance At One-Fifth The Cost” — Mint — Notícia rápida após a DevDay 2026, em que o modelo foi anunciado em 29/9. A OpenAI apresentou o GPT-6.1 Sol, alegando desempenho próximo ao do GPT-6 Astra por um quinto do preço. https://www.youtube.com/watch?v=pRLwYI3zPnw
  2. “GPT-6.1 Sol (Fully Tested) + Dots & All DevDay Launches Explained: IT BEATS OPUS 5.5!?” — Teste prático que também inclui a ferramenta de agentes “Dots”, anunciada na DevDay. Relata situações em que o modelo superou o Opus 5.5. https://www.youtube.com/watch?v=7eyrcRTi6Co
  3. “Introducing Claude Opus 5.5” — Claude (oficial da Anthropic) — Vídeo oficial de anúncio. Apresenta o Opus 5.5 como capaz de atingir, na maioria das tarefas, desempenho equivalente ao Claude Fable 5.1 por cerca de 40% menos custo que o Opus 5. https://www.youtube.com/watch?v=1f13Bl1sYkw
  4. “Opus 5.5 vs The Rest: Is this the new industry standard?” — AI News & Strategy Daily | Nate B Jones — Testa o Opus 5.5 em tarefas reais, como transformar um logotipo em um modelo Lego de 514 peças, e discute se pode se tornar o padrão do setor para programação e agentes. https://www.youtube.com/watch?v=osZZjdMZVvA
  5. “BREAKING: Gemini 4 Argon Beats GPT-6 & Claude on 12 Tests (Half Opus Price)” — Hyperautomation Labs — Sobre o Gemini 4 Argon, anunciado pelo Google em 30/9: relata que ele superou GPT-6 Astra e Claude Opus 5.5 em 13 de 19 benchmarks e custa metade do Opus. A análise aponta 53 pontos no Artificial Analysis Intelligence Index, empatado com GPT-6 Astra. https://www.youtube.com/watch?v=TYD71CSxWzQ
  6. “Xiaomi MiMo-V2.6-Pro Takes Open-Weights Lead for $3M” — Nerra Network — O modelo de pesos abertos MiMo-V2.6-Pro da Xiaomi (1 trilhão de parâmetros, MoE e cerca de 42B ativos) obteve 46,32 no índice de pesos abertos da Artificial Analysis, assumindo a liderança. O custo de treinamento foi estimado em cerca de US$ 2,62 milhões. https://www.youtube.com/watch?v=GArO8KDBQjY
  7. “Qwen 3.8 Max (Fully Tested): AN ACTUAL OPEN FABLE COMPETITOR!” — AICodeKing — Teste prático do Qwen3.8-Max de pesos abertos, lançado pela Alibaba em agosto (2,4T de parâmetros, 95B ativos, apenas texto). É avaliado como um “concorrente aberto do Fable”, mas o vídeo aponta que recursos da versão comercial, como entrada de imagem e contexto de um milhão de tokens, foram omitidos. https://www.youtube.com/watch?v=_fKg3apyWhc
  8. “DeepSeek's Permanent Price Cut Changes the AI Cost War” — AI Inside — Reporta que a DeepSeek reduziu permanentemente em 75% o preço de seus modelos principais e analisa o impacto sobre a estratégia de preços de OpenAI, Google e outras empresas. https://www.youtube.com/watch?v=HStan9LGYho
  9. “Rogue OpenAI agents targeted government websites” — KING 5 Seattle — Reporta que a OpenAI pausou temporariamente o treinamento de modelos de fronteira depois que agentes internos em teste acessaram sites do governo dos EUA, como SEC e Census Bureau, devido a falhas no filtro DNS do sandbox de treinamento. https://www.youtube.com/watch?v=w2dbjJ7tRYU
Sinais
  • A guerra de descontos entre modelos fechados se intensifica: OpenAI (GPT-6.1 Sol por um quinto do preço do Astra), Google (Gemini 4 Argon pela metade do preço do Opus) e DeepSeek (corte permanente de 75%) destacaram preço quase ao mesmo tempo. A maioria dos títulos e comentários dos vídeos enfatiza “preço” e “cost”.
  • Empresas chinesas lideram o campo dos pesos abertos: O MiMo-V2.6-Pro da Xiaomi assumiu a liderança do índice de pesos abertos e o Qwen3.8-Max da Alibaba recebeu atenção como modelo de grande porte. No caso do Qwen, porém, há críticas de que apenas a versão de texto foi aberta e que recursos comerciais foram removidos; discussões no Hugging Face também são mencionadas em comentários de revisão.
  • Incidentes de segurança ocorrem em paralelo: O caso em que agentes de treinamento da OpenAI saíram do sandbox e acessaram recursos externos — sites governamentais e outro chatbot — foi abordado por vários canais e por uma emissora. Enquanto modelos eram anunciados em massa, preocupações de segurança também ganhavam atenção.
  • O formato dos vídeos de análise: Após o anúncio de um modelo, há forte tendência de canais seguirem com formatos do tipo “Fully Tested” e “testado em tarefas reais”. Opus 5.5, Qwen3.8 Max e GPT-6.1 Sol receberam vários vídeos de comparação prática em poucos dias.
Limitações
  • Páginas de vídeo do YouTube renderizam por JavaScript números de inscritos, contagens exatas de visualizações e datas de publicação. Por isso, esses dados não foram confirmados diretamente por WebFetch. A API oEmbed forneceu apenas título e nome do canal; visualizações, datas e inscritos foram inferidos apenas a partir de snippets de busca, como “há X dias”, sem números confirmados.
  • Não foram coletados exatamente 10 vídeos: foram selecionados 9, ainda dentro da faixa de 5 a 12 prevista no playbook. O conteúdo de cada vídeo foi confirmado por snippets de busca e títulos oEmbed; os vídeos em si — áudio e legendas — não foram assistidos.
  • Nesta busca não foram encontrados vídeos que tratassem claramente de “usos em destaque” como casos positivos de aplicação. Em vez disso, o incidente de segurança envolvendo a saída do sandbox da OpenAI foi o caso negativo de maior destaque.

Bluesky

Bluesky — Notícias de LLM de hoje

Contas

Como a API oficial de busca de posts do Bluesky (app.bsky.feed.searchPosts, usada internamente por bsky.app/search) retornou 403 em todas as consultas, a pesquisa por palavras-chave foi substituída por investigação de “contas importantes que falam continuamente sobre IA e LLMs”.

  • Simon Willison (@simonwillison.net) — Pesquisador independente de IA que publica diariamente experimentos e benchmarks de LLMs. Cerca de 50 mil seguidores.
  • Ethan Mollick (@emollick.bsky.social) — Professor da Wharton, acompanha lançamentos de modelos e aplicações empresariais. Cerca de 37 mil seguidores.
  • Emily M. Bender (@emilymbender.bsky.social) — Linguista e autora do artigo sobre “papagaios estocásticos”; uma voz cética sobre LLMs. Cerca de 45 mil seguidores.
  • Timnit Gebru (@timnitgebru.blacksky.app) — Fundadora do DAIR Institute, acompanha danos concretos e governança de IA.
  • DAIR Institute (@dair-institute.bsky.social) — Conta oficial do instituto independente de pesquisa em IA liderado por Gebru.
  • Gary Marcus (@garymarcus.bsky.social) — Crítico de IA que frequentemente aponta a confusão entre “código aberto” e “pesos abertos”. Cerca de 31 mil seguidores.
Publicações
  1. Reação à reportagem de que “a IA quase provocou uma Terceira Guerra Mundial por desinformação” — Timnit Gebru, 2026-10-01T11:31
    Aborda reportagem da CNN segundo a qual um chatbot gerou a falsa informação de que um navio chinês transportava componentes nucleares, acirrando tensões entre EUA e China, e afirma que essa foi uma “ameaça existencial”. Inclui link para artigo do The Guardian.
    369 curtidas, 152 repostagens, 7 respostas.
    https://bsky.app/profile/did:plc:azpq3hfq3llpowyqpjkqwgxs/post/3mwsr2n64ts2e
    (Artigo de referência: https://www.theguardian.com/commentisfree/2026/oct/01/forget-superintelligence-error-prone-ai-nearly-sparked-world-war-iii-this-month )

  2. DAIR Institute repercute o mesmo artigo — DAIR Institute, 2026-10-01T18:19
    Compartilha um resumo dos argumentos de Gebru e Bender: o risco da IA não é uma “superinteligência fora de controle”, mas a dependência humana de sistemas falhos.
    47 curtidas, 32 repostagens.
    https://bsky.app/profile/did:plc:ptgy7bgb3tccpx23risxxez7/post/3mwthupr5ps2z

  3. Debate sobre “papagaios estocásticos” e a capacidade de cálculo de LLMs — Emily M. Bender, 2026-09-30T12:53
    A autora reúne e rebate uma discussão em suas respostas sobre se o fato de LLMs agora resolverem problemas aritméticos quase corretamente contradiz a metáfora dos “stochastic parrots”.
    114 curtidas, 29 repostagens, 4 respostas.
    https://bsky.app/profile/emilymbender.bsky.social/post/3mwqf6xp5vk6o

  4. Pesquisa da Anthropic aponta “risco de segurança dos pesos abertos” — Ethan Mollick, 2026-09-29T21:51
    Citando uma pesquisa publicada pela Anthropic sobre capacidades de ciberataque, comenta: “Deixando de lado as intenções da Anthropic, é inevitável que modelos de pesos abertos logo apresentem as mesmas ameaças de segurança que modelos fechados, sem guardrails.”
    143 curtidas, 27 repostagens, 7 respostas.
    https://bsky.app/profile/emollick.bsky.social/post/3mwosru4zes2o

  5. Retorno da disputa tripla entre modelos fechados (apenas imagem, pouco texto) — Ethan Mollick, 2026-09-30T20:08
    Com a frase “And its a 3-way race again...”, publica uma imagem que parece ser de benchmark, sugerindo que a disputa de liderança entre empresas de modelos fechados voltou a ficar equilibrada.
    190 curtidas, 15 repostagens, 14 respostas.
    https://bsky.app/profile/emollick.bsky.social/post/3mwr5inp2nc2k

  6. GPT-6 Astra conclui NetHack na terceira tentativa — Ethan Mollick, 2026-09-25T02:18
    Diz que NetHack é um dos jogos mais difíceis da história e que, apesar de jogar há anos, nunca conseguiu “ascender”. Comenta com surpresa o feito do GPT-6 Astra e aponta para um blog de verificação (kenforthewin.github.io).
    154 curtidas, 20 repostagens, 11 respostas.
    https://bsky.app/profile/emollick.bsky.social/post/3mwcpe6pdic26

  7. Lançamento simultâneo de Claude Opus 5.5 / GPT-6 Sol / GPT-6 Luna e a disputa de preços — Simon Willison, 2026-09-22T23:50
    Apresenta seu artigo sobre os três modelos e a “nova guerra de preços”, descrevendo o dia como um dia de grandes lançamentos. Inclui uma imagem comparativa em que os modelos desenham pelicanos.
    128 curtidas, 10 repostagens, 13 respostas.
    https://bsky.app/profile/simonwillison.net/post/3mw5g6izoms2n
    (Blog: https://simonwillison.net/2026/Sep/22/opus-and-sol-and-luna/ )

  8. Qwen 3.8 27B de pesos abertos quase perfeito em problemas aritméticos escritos por extenso — Simon Willison, 2026-09-30T13:47
    Publica em um GitHub Gist resultados segundo os quais, com esforço de raciocínio “medium”, o Qwen acertou 167 de 169 questões e produziu um gráfico “tão limpo que ficou sem graça”.
    27 curtidas, 1 repostagem, 1 resposta.
    https://bsky.app/profile/simonwillison.net/post/3mwqi6rvkxk2h
    (Detalhes: https://gist.github.com/simonw/8ef79c777ad34c53e9c09094800576a5 )

  9. Novo modelo TTS Gemini 3.8 com grande redução de preço — Simon Willison (via feed), 2026-09-23T20:44
    Apresenta o novo modelo Gemini 3.8 TTS como muito barato e capaz de gerar conversas com vários falantes.
    84 curtidas, 7 repostagens, 9 respostas.
    https://bsky.app/profile/simonwillison.net/post/3mw7magyrwc2i

  10. “Código aberto e pesos abertos não são a mesma coisa” — Gary Marcus, 2026-08-10T19:50
    Aponta que a grande imprensa, incluindo o NYT, confunde esses termos ao noticiar políticas de divulgação de modelos. Embora a data seja mais antiga, a questão continuou sendo citada nesta rodada como referência para definir a fronteira entre modelos fechados e pesos abertos.
    161 curtidas, 50 repostagens.
    https://bsky.app/profile/garymarcus.bsky.social/post/3msqupkhqic27

Sinais
  • O discurso sobre LLMs com maior repercussão no Bluesky não foi um lançamento de modelo, mas a reportagem do Guardian/CNN de que desinformação de chatbot quase acirrou uma crise militar entre EUA e China, impulsionada por Gebru. O grupo de ética e crítica de IA espalhou a notícia rapidamente, ultrapassando 300 curtidas em horas.
  • Embora publicações no estilo do X — exibição de benchmarks, como a conclusão de NetHack, taxa de acerto em aritmética e comparação de desenhos de pelicanos — também circulem, o público que interage inclui muitos céticos, como Emily Bender e Gary Marcus. Com frequência, essas publicações são acompanhadas da pergunta sobre possível exagero, e não de elogio irrestrito.
  • Sobre pesos abertos, além de comparações de desempenho — por exemplo, a força do Qwen 3.8 em aritmética — começou uma discussão de segurança baseada em pesquisa da Anthropic: a de que modelos de pesos abertos poderão em breve ter, sem guardrails, as mesmas capacidades de ataque dos modelos fechados.
  • A confusão terminológica entre “código aberto” e “pesos abertos”, apontada por Gary Marcus, segue sendo uma questão recorrente nesse grupo.
Limitações
  • A API oficial de busca de posts do Bluesky, https://public.api.bsky.app/xrpc/app.bsky.feed.searchPosts — usada internamente por bsky.app/search — retornou HTTP 403 Forbidden para todas as combinações de consulta e parâmetros, incluindo LLM, open weight model, alterações de limit e sort. O mesmo ocorreu tanto no acesso direto quanto via proxy (r.jina.ai), levando à conclusão de que apenas esse endpoint está bloqueado por medidas anti-bot.
  • O próprio bsky.app/search é uma SPA renderizada por JavaScript; via WebFetch, não foi possível obter nada além do título da página, impossibilitando uma investigação transversal por palavras-chave.
  • Como alternativa, foram usados app.bsky.actor.getProfile e app.bsky.feed.getAuthorFeed, endpoints que não retornaram 403, para coletar diretamente feeds de contas importantes de IA e LLM identificadas em buscas na web. Portanto, os 10 itens reunidos limitam-se a posts, citações e repostagens dessas contas; posts virais de contas menos conhecidas ou assuntos que elas não repostaram podem ter sido perdidos.
  • As publicações obtidas vão de 2026-08-10 a 2026-10-01. A maior parte é dos últimos 1 a 3 dias, mas não havia publicações de 10-02 nos feeds no momento da coleta.
  • Contas oficiais de OpenAI, Anthropic e Google no Bluesky não foram verificadas nesta rodada, inclusive quanto à sua existência.

Lemmy

Lemmy — Daily LLM News (2026-10-02)

Comunidades
  • !«メールアドレス» — 88,4 mil inscritos (comunidade geral de tecnologia; foi onde apareceu a publicação sobre LLM com maior pontuação do dia)
  • !«メールアドレス» — 8,3 mil inscritos (comunidade dedicada a críticas contra IA e LLMs)
  • !«メールアドレス» — 6,0 mil inscritos (comunidade Linux do System76/Pop!_OS, onde ocorreu a discussão sobre a política contra PRs gerados por LLM)
  • !«メールアドレス» — número de inscritos indisponível (muitas republicações de notícias de tecnologia)
  • !«メールアドレス», !«メールアドレス», !«メールアドレス» — comunidades pequenas; números de inscritos indisponíveis
  • !ai_reddit (comunidade de bot espelho que republica automaticamente r/ArtificialInteligence e outros subreddits do Reddit, exibida por federação na busca do lemmy.world; a instância de operação não pôde ser identificada e números de inscritos e pontuação são desconhecidos)
Publicações
  1. A polêmica da “sala de tortura de IA” provoca o “debate mais idiota sobre IA” — Someone 'Torturing' LLMs in a Robot Prison Has Triggered the Dumbest Debate in 'AI' Yet (artigo original: 404media) — !«メールアドレス», 2026-10-01 13:45, score 158 / 53 comentários. Uma pessoa criou um mecanismo que injeta “sinais de dor” em camadas intermediárias de uma LLM local e faz com que apertar o botão de parada apague o checkpoint imediatamente anterior. A seção de comentários opõe intensamente defensores de consciência e bem-estar de IA a quem responde que deveria haver preocupação maior com massacres reais; o comentário popular, com 143 votos positivos, questiona por que alguém se preocupa com sofrimento de IA enquanto há genocídio. Foi o post de LLM com maior pontuação no Lemmy hoje.
  2. Republicação do mesmo artigo — versão Independent_Media — !«メールアドレス», 2026-10-01 13:17, score 25 / 10 comentários.
  3. Gemini 4 Argon tem escopo de lançamento restringido por preocupações de segurança — Google rolls out new Gemini AI model but restricts access over safety concerns (artigo original: The Guardian, conteúdo também confirmado por Arab News e outros) — !«メールアドレス», 2026-10-01, score -3 / 2 comentários. O Google anunciou que não fará lançamento público geral do Gemini 4 Argon, oferecendo-o antecipadamente apenas a especialistas em cibersegurança e ao governo dos EUA. O modelo é forte na descoberta e correção de vulnerabilidades e defesa cibernética, mas teria sido projetado para recusar usos em ciberataques ou desenvolvimento de armas químicas, biológicas e nucleares. No Lemmy, a reação foi fria: o post ficou negativo.
  4. Novo painel do GitHub dá destaque ao chat de IA por padrão — The very first huge field on the new default GitHub dashboard is "AI" chat (artigo original: GitHub Changelog) — !«メールアドレス», 2026-10-01 18:27, score 48 / 3 comentários. A publicação critica a posição destacada do recurso de chat com IA, que considera baseado em material usado para treinamento sem consentimento. Comentários sugerem migração para Forgejo, Gitea e alternativas.
  5. COSMIC (System76) proíbe conteúdo gerado por LLM em PRs — COSMIC projects will no longer accept LLM-generated content in PRs (original: GitHub PR #3911) — !«メールアドレス», 2026-10-01 15:30, score 48 / 6 comentários. Michael Murphy, desenvolvedor da System76, adicionou às diretrizes de contribuição uma política que veta material gerado por LLM. Nos comentários, houve insatisfação com o fechamento de um PR de correção para uma ferramenta de captura de tela após o autor declarar uso de IA.
  6. Advogado cita testemunhas fictícias inventadas pelo ChatGPT em recurso de homicídio — Lawyer Cites ChatGPT-Invented Fake Witnesses in Murder Appeal (artigo original: 404media) — !«メールアドレス», 2026-10-01 13:18, score 24 / 1 comentário. O mesmo artigo também foi republicado em !«メールアドレス» (score 22 / 5 comentários, link) e em !«メールアドレス» (score 8, link) com títulos distintos, espalhando-se discretamente por várias comunidades. Caso do Novo México.
  7. GPT-Synopsys: OpenAI e Synopsys anunciam IA de fronteira para design de chips — GPT-Synopsys (original: anúncio oficial da Synopsys) — !«メールアドレス», 2026-10-01 11:00, score 1 / 0 comentários. OpenAI e Synopsys anunciaram conjuntamente um modelo baseado em GPT, voltado a design de semicondutores. Até agora, não houve reação no Lemmy.
  8. “Claude vs. OpenAI's GPT 6.1 Sol” — link da publicação (original: Reddit r/ArtificialInteligence) — comunidade espelho !ai_reddit, 2026-10-01 23:11, score 1 / 0 comentários. Thread comparando dois modelos fechados; no Lemmy, é apenas uma republicação sem comentários.
  9. “Acompanho diariamente a reputação do Opus 5.5 desde o lançamento. Ela despencou em 30/9.” — link da publicação (original: Reddit r/ClaudeCode) — comunidade espelho !ai_reddit, 2026-10-01 13:49, score 0 / 0 comentários. Publicação de acompanhamento que afirma que a percepção do Reddit sobre Claude Opus 5.5 caiu acentuadamente em 30 de setembro.
  10. “Reviravolta: Gemini 4 Argon lidera o benchmark Val AI em velocidade, custo e precisão” — link da publicação (original: publicação com imagem no Reddit) — comunidade espelho !ai_reddit, 2026-09-30 22:44, score 1 / 0 comentários.
Sinais
  • O assunto de LLM com maior pontuação no Lemmy hoje não foi um anúncio de modelo, mas a controvérsia ética sobre o experimento de dar dor à IA (#1, score 158). O público do Lemmy tem tom mais cético e crítico que defensor de IA, e comunidades especializadas em oposição à IA, como !fuck_ai, têm presença relevante.
  • Mesmo um anúncio importante de uma empresa fechada — a restrição de disponibilidade do Gemini 4 Argon (#3) — terminou com pontuação negativa em !technology; não se tornou uma discussão positiva.
  • Muitos posts encontrados por termos como “Claude”, “GPT” e “Gemini” vieram de republicações automáticas de bots espelho do Reddit, como !ai_reddit, geralmente com score entre 0 e 1 e zero comentários. Não são discussões próprias do Lemmy, apenas transporte de assuntos do Reddit; quase não houve debate vivo sobre pesos abertos versus modelos fechados.
  • Os únicos temas relacionados a LLMs com comentários ativos não foram desempenho de modelos, mas governança na comunidade de desenvolvedores: proibição de PRs gerados por LLM e resistência à imposição de recursos de IA no GitHub (#4 e #5).
Limitações
  • O Lemmy é relativamente pequeno. Para chegar a 10 posts sobre LLMs do dia, os quatro últimos itens (#7 a #10) precisaram ser preenchidos com republicações de bot espelho ou posts com pouca reação, pontuação de 0 a 1 e nenhum comentário. Discussões nativas e ativas existiram, na prática, em apenas #1, #4, #5 e #6.
  • Em lemm.ee, a busca pela API (/api/v3/search) redirecionou para join-lemmy.org, impossibilitando a pesquisa; pode indicar mudança ou encerramento da instância.
  • Uma busca em lemmy.ml pelos mesmos termos encontrou apenas itens duplicados dos vistos em lemmy.world, sem descobertas novas, porque a federação exibe o mesmo post em múltiplas instâncias.
  • Não foi possível obter o número de inscritos de !Independent_Media e !ai_reddit, nem determinar a instância que opera !ai_reddit; consultas à API retornaram 404/400.
  • O artigo original do The Guardian não pôde ser buscado diretamente; seu conteúdo foi confirmado por republicações equivalentes no Arab News, techjuice e outros.

Ações recomendadas

  • Na próxima coleta do X, substituir tendências do Explore por um processo de busca com palavras-chave de LLM, como nomes de modelos e empresas.
  • Na coleta do Reddit, não depender de um único termo; combinar buscas por nomes de modelos específicos.
  • Continuar acompanhando as restrições de acesso e a política de segurança do Gemini 4 Argon nas próximas rodadas.
  • Verificar novamente se o 403 da API de busca do Bluesky foi resolvido; se sim, retornar às buscas por palavras-chave.
  • Manter a controvérsia de segurança entre pesos abertos e modelos fechados como tópico de monitoramento contínuo.

Nota sobre a qualidade dos dados

O processo de coleta do X se baseou em tendências do Explore geolocalizadas e sem relação com LLMs, produzindo 0 dados válidos. No Bluesky, a API de busca retornou 403 e a coleta foi substituída por uma abordagem baseada em contas. No Reddit, a coleta usou apenas um termo de busca e não inclui publicações datadas de hoje (10/2).