#benchmarks-de-llm
19 posts
2026 - julho
4 posts2026 - junho
3 posts2026 - maio
1 post2026 - abril
4 posts- LLM Benchmarks: Vale a Pena ($$) Misturar 2 Modelos? (Planner + Executor)
- Benchmark de LLMs pra Coding (Maio 2026): DeepSeek v4, Kimi v2.6, Grok 4.3, GPT 5.5
- LLM Benchmarks Parte 2: Vale Combinar Múltiplos Modelos no Mesmo Projeto? Claude + GLM??
- Testando LLMs Open Source e Comerciais - Quem Consegue Bater o Claude Opus?
2026 - janeiro
4 posts2025 - maio
1 post2025 - abril
2 posts2026 - julho
4 postsLLM Benchmark: Devo usar o que tem nota maior?
Por que o primeiro lugar num ranking de LLMs não é necessariamente o melhor modelo, por que 90+ é um cluster e como usar benchmarks sem terceirizar sua decisão técnica.
LLM Benchmark: Kimi K3 chegou no nível do Claude Opus?
Coloquei o Kimi K3 para criar sozinho um chat em Rails 8: fez 89/A, superou o Opus 4.6 e foi uma alternativa mais barata ao Opus 4.8. Ainda ficou atrás dele em arquitetura, hardening e testes.
LLM Benchmarks: Grok 4.5 e GPT 5.6 Sol
Grok 4.5 entrou na Tier A com 87, e GPT 5.6 Sol marcou 92. O Sol venceu o GPT 5.5 por 92 a 81 no A/B cego, mas a reauditoria o levou a 85. Com o cache-read corrigido, Opus 4.8 segue o melhor equilíbrio na API.
LLM Benchmark: Sonnet 5 falha, Gemini Flash surpreende, Sakana Fugu quase chega ao Tier A
No benchmark de coding, Sonnet 5 marcou 58/100 porque chamou uma API inexistente, enquanto Gemini 3.5 Flash fez 93/100. Sakana Fugu Ultra ficou em 79/100, perto do Tier A.
2026 - junho
3 postsLLM Benchmark: Kimi v2.7 code, GLM 5.2, Minimax M3 local
No benchmark, GLM 5.2 marcou 87 e Kimi K2.7 Code, 86. O MiniMax M3 aberto não cabe em 128 GB, enquanto programação séria ainda pede Opus 4.8 ou GPT 5.5.
LLM Benchmark: Fable 5 e a novela da Anthropic
Fable 5 marcou 94/100, praticamente empatado com o Opus 4.8, mas custa dez vezes mais e redireciona tarefas sensíveis. Como o Mythos não é auditável, fico no 4.8.
LLM Benchmarks - Atualizando sobre Grok 4.3, MiniMax v3 e Opus 4.8
No benchmark Rails 8, Opus 4.8 mantém a liderança com 95/100, enquanto Grok 4.3 e MiniMax M3 enfim ficam usáveis, mas seguem no Tier B e atrás de GPT e Opus.
2026 - maio
1 postLLM Benchmarks: DeepSeek Destravado! Use DeepClaude
Troquei o harness do opencode pelo loop do Claude Code via DeepClaude e o DeepSeek V4 Pro subiu de 69/B para 89/A em 18 minutos e $3,14. O bug de multi-turn no controller continua.
2026 - abril
4 postsLLM Benchmarks: Vale a Pena ($$) Misturar 2 Modelos? (Planner + Executor)
Três rodadas mostram que multi-agente não supera o Opus 4.7 solo no opencode, que fez 97/100 em 18 minutos por cerca de $4. GPT 5.4 xHigh com executor medium economiza, mas perde 3 pontos.
Benchmark de LLMs pra Coding (Maio 2026): DeepSeek v4, Kimi v2.6, Grok 4.3, GPT 5.5
Reauditei 24 LLMs na mesma aplicação Rails com RubyLLM: Opus 4.7 e GPT 5.4 empatam em 97, GPT 5.5 chega a 96, Kimi e Gemini viram Tier A, e DeepSeek V4 Pro só atinge Tier A via DeepClaude.
LLM Benchmarks Parte 2: Vale Combinar Múltiplos Modelos no Mesmo Projeto? Claude + GLM??
Testei sete combinações em Claude Code, opencode e Codex, mas nenhum sub-agente foi chamado. A variância entre runs e harnesses mantém Opus sozinho como padrão para projetos greenfield.
Testando LLMs Open Source e Comerciais - Quem Consegue Bater o Claude Opus?
Este benchmark histórico comparou 33 LLMs num app Rails: Opus, Sonnet e GLM 5 funcionaram, enquanto Qwen 3.6 35B chegou perto na RTX 5090 após uma correção. Os rankings foram depois revisados.
2026 - janeiro
4 postsVibe Code: Qual LLM é a MELHOR?? Vamos falar a REAL
Submeti o mesmo app a análises de Opus, GPT 5.2 Codex, Kimi, Gemini e MiniMax. Cada modelo encontrou problemas diferentes, mas nenhum eliminou a necessidade de revisão humana.
AI Agents: Qual é o melhor? OpenCode, Crush, Claude Code, GPT Codex, Copilot, Cursor, Windsurf, Antigravity?
Comparei agentes como Crush, OpenCode, Claude Code e Codex e concluí que os harnesses proprietários ainda influenciam o resultado. Mesmo assim, continuo preferindo o Crush e uso Claude Code pontualmente.
AI Agents: GLM 4.7 Flash é realmente tão bom assim?
Rodei o GLM 4.7 Flash localmente numa RTX 5090 e ele foi o único modelo open source a compilar o desafio de Zig. O comportamento foi bom, mas ampliar o contexto o deixou até 20 vezes mais lento.
AI Agents: Comparando as principais LLM de 2026 no Desafio de Zig
Testei LLMs comerciais e open source numa migração difícil de Zig 0.15 com llama.cpp. Só as comerciais concluíram, e Claude Opus venceu por resolver tudo mais rápido e com menos insistência.
2025 - maio
1 postRant - LLMs vão evoluir pra sempre? Desmistificando LLMs na programação
Após testar Claude, Gemini, Qwen e outros em refatorações reais, questiono benchmarks, evolução exponencial e Vibe Coding. LLMs ajudam, mas ainda dependem de programadores atentos para revisar e corrigir.
2025 - abril
2 postsTestando o Recém Lançado LLM Open Source - Qwen3 (com Aider e Ollama)
Testei o Qwen3 com Aider, localmente e via OpenRouter, em refatorações e testes. O 14B foi muito mais rápido e competente que o Qwen2.5, embora o Gemini ainda tenha levado vantagem.
Testando LLMs com Aider na RunPod - qual usar pra código?
Comparei modelos de código com Aider na RTX 4090, A40 e H100. O Qwen2.5-Coder 32B foi lento e frustrante, enquanto o 7B se saiu melhor, mas Claude e Gemini venceram.