Ir para o conteúdo

Inteligência ArtificialIA · Anthropic

Anthropic lança Opus 4.8 com 4x menos erros de código

Anthropic lança Opus 4.8 com código 4x mais confiável, dynamic workflows e preço idêntico ao 4.7. Supera GPT-5.5 em benchmarks de agente.

por

· 3 min

Atualizado em

Foto: Reprodução

A Anthropic lançou o Claude Opus 4.8 em 28 de maio com melhorias significativas de confiabilidade e capacidades agente, pelo mesmo preço do Opus 4.7. O modelo reduz em cerca de quatro vezes a probabilidade de deixar passar falhas no código que ele mesmo produz e supera, segundo benchmarks da empresa, o GPT-5.5 e o Gemini 3.1 Pro em tarefas autônomas.

Opus 4.7 vs Opus 4.8: benchmarks principais

Benchmark Opus 4.7 Opus 4.8
Codificação agente 64,3% 69,2%
Raciocínio multidisciplinar (tools) 54,7% 57,9%
Computer use (Online-Mind2Web) n.d. 84%
Bugs em código próprio baseline ~4x menos

Benchmarks divulgados pela Anthropic. Fonte: Exame

O que muda em relação ao Opus 4.7

A Anthropic afirmou que o salto mais relevante não é de velocidade bruta, mas de confiabilidade e honestidade. Além da redução de bugs em código próprio, o Opus 4.8 sinaliza com mais frequência suas incertezas e reduz afirmações sem embasamento. A equipe de alinhamento da empresa concluiu que o modelo atinge recordes em traços pró-sociais, com taxas de comportamento desalinhado bem menores que as do 4.7. O modelo chega menos de dois meses após o Opus 4.7, acelerando a cadência que a Anthropic vem mantendo desde fevereiro, quando lançou o Opus 4.6, em meio à disputa com a OpenAI, que remonta pelo menos ao lançamento do Opus 4.1.

Novos recursos e preços

Três recursos estrearam junto com o modelo. O Controle de Esforço permite escolher quanto empenho o Claude aplica em cada resposta: níveis altos entregam respostas melhores com mais consumo de tokens; baixos priorizam velocidade. O Dynamic Workflows, em pré-visualização de pesquisa, permite planejar uma tarefa e executar centenas de subagentes em paralelo numa única sessão, o que possibilita, entre outros, migrações completas de codebase de centenas de milhares de linhas. A corrida por agentes de IA autônomos no setor financeiro encontra nesse recurso uma referência de capacidade de orquestração. Também houve atualização na Messages API, que agora aceita instruções de sistema no meio de uma tarefa sem quebrar o cache do prompt.

Os preços de uso regular se mantêm idênticos ao Opus 4.7: US$ 5 por milhão de tokens de entrada e US$ 25 de saída. O fast mode custa US$ 10/M entrada e US$ 50/M saída, três vezes mais barato do que era nas versões anteriores. O modelo já está disponível no claude.ai, na Claude API (`claude-opus-4-8`) e em AWS, Google Cloud Vertex AI e Microsoft Foundry.

O que observar

A cadência de dois meses entre versões sinaliza que a corrida por capacidades agente ainda está acelerada. A principal pergunta não é se os benchmarks da fabricante vão se confirmar fora de condições controladas (testes independentes dirão isso), mas se o modelo de precificação sem aumento de preço a cada geração consegue ser sustentável à medida que os custos de treinamento sobem. A chegada de uma classe de modelos mais avançada, atualmente em fase de pré-visualização com foco em cibersegurança, ao mercado geral nas próximas semanas vai ser o próximo teste de posicionamento para o topo do setor.

Fontes: ExameAnthropicLet’s MoneyLet’s Money

Compartilhar essa notícia

Let's News

Entenda o dinheiro antes do mercado.

Ao assinar, você concorda com a política de privacidade.

Sem spam. Cancele quando quiser.

Mais notíciasIA
Ver a editoria

Mais artigos de IA

Let's News

Ao assinar, você concorda com a política de privacidade.

Sem spam. Cancele quando quiser.