O que é o relatório
É a versão 1.1 de uma avaliação recorrente da Mozilla, que substitui a primeira edição, de julho. Os dados vão até 1º de setembro de 2026. No texto, “aberto” quer dizer pesos disponíveis para download: dos 16 lançamentos abertos que o relatório analisa, nenhum publica a receita de dados que a definição de código aberto da OSI pede. A Ars Technica recebeu o material antes da publicação e noticiou em 15 de setembro.
O placar geral
O Artificial Analysis Intelligence Index (versão 4.1.1) combina nove avaliações, entre elas Terminal-Bench 2.1, Humanity’s Last Exam e GPQA Diamond. Os primeiros colocados em 1º de setembro:
| Modelo | Tipo | Índice | Preço por milhão de tokens (entrada/saída) | |—|—|—|—| | Claude Opus 5 | fechado | 63,0 | US$ 5 / 25 | | Claude Fable 5 | fechado | 62,1 | US$ 10 / 50 | | GPT-5.6 Sol | fechado | 61 | US$ 5 / 30 | | Grok 4.6 | fechado | 61 | US$ 2 / 6 | | Kimi K3 (Moonshot AI) | aberto | 60 | US$ 3 / 15 | | GLM-5.3 (Z.ai) | aberto | 60 | US$ 1,15 / 3,50 | | Qwen 3.8 Max (Alibaba) | aberto | 58 | US$ 2 / 6 | | GLM-5.3 Flash (Z.ai) | aberto | 57 | US$ 0,075 / 0,25 | | GPT-5.6 Terra | fechado | 57 | US$ 2 / 12 |
O Muse Spark 1.2, da Meta, também marca 57, mas os pesos foram prometidos e ainda não publicados.
Contra o Fable 5, o K3 fica 2,1 pontos atrás a 30% do preço de entrada; contra o Opus 5, líder, fica 3 pontos atrás a 60%. O relatório faz duas ressalvas. O Fable 5 e o Sol são pontuados como sistemas com proteções e alternativas de reserva, e o K3 como modelo puro. E o preço por token engana: por tarefa concluída do índice, o K3 sai por cerca de US$ 0,86 e o Sol por US$ 1,23, uns 30% a menos, diferença menor que a do preço de lista, porque o K3 é mais lento e gasta mais tokens. A Artificial Analysis anunciou a versão 4.2 do índice em 4 de setembro, depois do recorte usado.
Quanto tempo de atraso
Duas medidas chegam perto de quatro meses:
– Epoch Capabilities Index. Fable 5 e Opus 5 marcam 162, o K3 marca 157. A Epoch AI calcula que, desde janeiro de 2026, a diferença média entre o melhor aberto e o melhor fechado é de 8 pontos, cerca de quatro meses, e diz que o número pode estar subestimado: abertos otimizam mais para benchmark, e fechados não lançados ficam fora da conta. – Horizonte de tarefas do METR. Um ajuste da Mozilla sobre os dados brutos do METR dá atraso de cerca de 4,4 meses. O tamanho da tarefa que os modelos completam dobra a cada 3,9 meses nos abertos e a cada 5,5 meses nos fechados. A própria Mozilla chama o cálculo de reprodução simplificada, e o METR estima margens de erro de cerca de duas vezes.
Daí sai a regra de uso proposta no relatório: tarefas de menos de 8 horas qualquer um resolve, e acima de 12 horas nenhum resolve. O prêmio de cerca de cinco vezes por tarefa só compensa nessa faixa, quando quatro meses de vantagem valem o custo.
Onde cada lado vence
– Código de interface: o K3 estreou em 1º lugar na Frontend Code Arena do LMArena, com 1679 de Elo. – Trabalho em terminal: o relatório classifica como disputado: 88,3 do K3 contra 88,8 do Sol no Terminal-Bench 2.1. No FrontierSWE, que mede a resolução de tickets reais de software, o Fable 5 marca 86,6 e o K3 81,2. – Trabalho profissional especializado: o Fable 5 abre 92 de Elo sobre o K3 no GDPval-AA v2, a maior distância entre os testes comuns aos dois. – Contexto longo: buscando vários trechos em 1 milhão de tokens, o Gemini 3.1 Pro acerta 89% e o DeepSeek V4-Pro, 41%. – Mesmo ambiente, preços diferentes: no Terminal-Bench 2.1 rodado pela vals.ai com a mesma estrutura para todos, o GLM 5.2 marca 67,79% a US$ 0,43 por tarefa e o Claude Opus 4.7, 68,54% a US$ 1,98.
O relatório avisa que a maior parte desses placares por tarefa vem de testes dos próprios fabricantes e deve ser lida como indicativa. À Ars Technica, o CTO da Mozilla, Raffi Krikorian, resumiu onde o fechado ainda cobra caro: “trabalho profissional especializado, recuperação intensa de informação e contexto longo”.
Quem mediu
A Mozilla se declara parte interessada: defende publicamente a IA aberta, e o braço de investimentos Mozilla Ventures tem participação em empresas citadas no relatório. O documento também informa que usou IA na edição e na redação, e que cada número foi conferido por uma pessoa na fonte original.

