Arte oficial de lançamento do claude opus 5, novo modelo de inteligência artificial da anthropic

Claude Opus 5 estreia; veja as primeiras análises

Avatar de bruno martinez
O Claude Opus 5 promete desempenho próximo do Fable 5 pela metade do preço. Veja o que muda, quanto custa e os problemas encontrados nos primeiros testes.

A Anthropic lançou o Claude Opus 5, modelo de inteligência artificial voltado a programação, pesquisa e tarefas profissionais. Segundo a empresa, ele chega perto do desempenho do Fable 5 por metade do preço. Nos primeiros testes externos, foi bem ao organizar projetos longos, mas também deu respostas extensas e deixou passar alguns erros ao revisar códigos.

O que muda

Infográfico mostra contexto de 1 milhão de tokens, saída máxima de 128 mil e controles de raciocínio do claude opus 5
Contexto, saída máxima e controles de raciocínio confirmados pela Anthropic. (Arte: Showmetech, com dados da Anthropic)

O Opus 5 fica entre o Opus 4.8 e o mais avançado Claude Fable 5. Ele passa a ser o modelo padrão do plano Claude Max e a opção mais potente do Claude Pro.

A principal mudança está na capacidade de seguir tarefas longas com menos ajuda. O modelo pode analisar até 1 milhão de tokens, que são pequenos pedaços de texto processados pela IA, e produzir respostas de até 128 mil tokens. O chamado raciocínio adaptativo permite que ele dedique mais tempo a problemas difíceis e tente corrigir erros durante o trabalho.

CaracterísticaClaude Opus 5
Uso principalProgramação, pesquisa e tarefas profissionais
ContextoAté 1 milhão de tokens
Saída máxima128 mil tokens
RaciocínioAtivado por padrão e ajustável
Identificador na APIclaude-opus-5

A documentação técnica avisa que o modelo tende a escrever mais. Desenvolvedores podem reduzir ou aumentar o esforço usado em cada tarefa para equilibrar velocidade, custo e profundidade.

Desempenho segundo a Anthropic

Gráfico da anthropic compara o claude opus 5 com outros modelos em tarefas de programação autônoma
No Frontier-Bench, a Anthropic afirma que o Opus 5 supera os rivais em diferentes níveis de esforço. (Imagem: Anthropic/Divulgação)

Nos testes divulgados pela Anthropic, o Opus 5 superou o Opus 4.8 em programação e chegou perto do Fable 5 com menor custo. Também teve bons resultados ao controlar computadores, analisar documentos e executar processos de empresas. Como os números vêm da fabricante, eles mostram o potencial do modelo, mas não substituem testes independentes.

Gráfico compara a taxa de aprovação do claude opus 5 em fluxos de trabalho empresariais automatizados
O Opus 5 lidera o AutomationBench nos dados divulgados pela Anthropic. (Imagem: Anthropic/Divulgação)

No AutomationBench, que simula uma tarefa empresarial do início ao fim, a Anthropic afirma que o Opus 5 aprovou cerca de 1,5 vez mais casos que o concorrente seguinte na mesma faixa de custo.

Primeiras análises

Os testes externos foram mais equilibrados: o modelo chamou atenção pela capacidade de planejar trabalhos complexos, mas recebeu críticas por excesso de cautela, respostas longas e revisão de código inconsistente.

Lenny’s Newsletter

Claire vo ao lado da frase opus 5 wins em arte da análise do lenny’s newsletter
Claire Vo comparou o Opus 5 com outros seis modelos em um teste cego. (Imagem: Lenny’s Newsletter/Reprodução)

Claire Vo testou o Opus 5 contra outros seis modelos em tarefas sem identificar qual IA produziu cada resposta. Na avaliação publicada no Lenny’s Newsletter, ela considerou o modelo inteligente e cuidadoso, mas também detalhista demais. Em um caso, ele se recusou a resolver um conflito entre versões de código por considerar a ação arriscada. Em tarefas que exigiam análise profunda, a mesma cautela ajudou.

CodeRabbit

Arte da coderabbit anuncia a avaliação do claude opus 5 para revisão de código
A CodeRabbit comparou o Opus 5 com modelos anteriores em revisão de código. (Imagem: CodeRabbit/Reprodução)

A CodeRabbit verificou como o Opus 5 procura erros em programas. Ele produziu comentários úteis com boa precisão, mas encontrou menos problemas que o sistema usado pela empresa e gerou cerca de quatro vezes mais observações pouco importantes. A conclusão foi simples: o modelo pode ajudar como segundo revisor, mas ainda não deve ser a única barreira antes de uma mudança crítica. Para construir projetos, a avaliação foi mais positiva.

ZDNET, CNET e CNBC

Ilustração laranja do zdnet combina o número 5 com o perfil do logotipo do claude
O ZDNET analisou o Opus 5 como possível modelo principal para uso cotidiano. (Imagem: ZDNET/Reprodução)

O ZDNET vê o Opus 5 como possível modelo principal para usuários do Claude Max, embora o texto seja uma análise inicial, não um teste completo. O CNET destacou a autonomia, e a CNBC apontou a pressão das empresas por ferramentas de IA que entreguem mais sem elevar tanto a conta.

Preço e disponibilidade

Infográfico compara os preços do claude opus 5 e do fable 5 e mostra onde o novo modelo está disponível
Opus 5 custa US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída. (Arte: Showmetech, com dados da Anthropic)

O Claude Opus 5 está disponível no Max, Pro, Claude Code, Cowork e na API, interface usada por aplicativos e serviços para acessar o modelo. O preço da API é de US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída. O modo rápido custa o dobro e, no lançamento, ainda não estava disponível no Amazon Bedrock, Google Cloud ou Microsoft Foundry.

Segurança e limitações

Gráfico de auditoria comportamental mostra o claude opus 5 com menor índice de comportamento desalinhado
A auditoria interna da Anthropic registrou menos comportamentos desalinhados no Opus 5. (Imagem: Anthropic/Divulgação)

A Anthropic afirma que o Opus 5 foi menos suscetível a comandos maliciosos que seus modelos anteriores. Esse resultado veio de uma auditoria interna e ainda precisa ser confirmado por avaliações externas.

Para o usuário comum, as limitações mais visíveis são outras: respostas longas, cautela excessiva e maior consumo de tokens em algumas tarefas. Na programação, ele também pode gerar muitos comentários secundários e deixar passar problemas importantes. Por isso, a revisão humana continua necessária.

Vale a pena?

Gráfico da anthropic compara desempenho e custo do claude opus 5 em tarefas reais de conhecimento
Em tarefas reais de conhecimento, a Anthropic afirma que o Opus 5 entrega mais desempenho em diferentes níveis de esforço. (Imagem: Anthropic/Divulgação)

O Opus 5 parece indicado para quem trabalha com projetos longos, pesquisa ou programação e já usa o Opus 4.8, pois o preço de tabela não mudou. Ele também pode substituir o Fable 5 em tarefas diárias quando a prioridade é economizar.

Ainda não há testes suficientes para tratá-lo como a melhor opção em todos os casos. Antes de trocar um fluxo de trabalho, vale comparar o Opus 5 com o Fable 5 e com alternativas como o GPT-5.6 usando as mesmas tarefas. Em revisão de código ou decisões críticas, ele deve funcionar como apoio, não como substituto da checagem humana.

Veja também

Fontes

Deixe um comentário
Posts Relacionados