Get the latest on AI, LLMs & developer tools
New MCP servers, model updates, and guides like this one — delivered weekly.
Resumo da Migração
O guia oficial de migração do Claude afirma que o código que já está sendo executado no Claude Opus 4.7 deve continuar funcionando no Opus 4.8 sem alterações disruptivas na API. Isso não significa que você deva alterar cegamente o ID do modelo em produção. O Opus 4.8 recalibra o esforço, define o esforço alto como padrão em todos os lugares, reduz o mínimo de prompt-cache e adiciona mensagens de sistema no meio da conversa.
Minimal migration: 1. Replace claude-opus-4-7 with claude-opus-4-8. 2. Keep adaptive thinking, not manual budget_tokens. 3. Keep sampling params omitted. 4. Re-baseline effort, latency, and cost. 5. Run your eval suite before production rollout.
ID do modelo
Usar claude-opus-4-8 na Claude API. A visão geral dos modelos lista o Opus 4.8 como a principal escolha para raciocínio complexo, codificação agente de longo prazo e trabalho de alta autonomia. Também documenta a janela de contexto de 1M na Claude API, Bedrock e Vertex AI, com 200k no Microsoft Foundry.
import anthropic
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-4-8",
max_tokens=64000,
thinking={"type": "adaptive"},
output_config={"effort": "xhigh"},
messages=[
{"role": "user", "content": "Review this architecture migration plan."}
],
)Restrições herdadas
O Opus 4.8 herda duas restrições do Opus 4.7. Primeiro, parâmetros de amostragem não padrão não são suportados. Se você enviar temperature, top_p, outop_k com valores não padrão, a API retorna um erro 400. Segundo, orçamentos manuais de pensamento estendido não são suportados. Não envie thinking: {type: "enabled", budget_tokens: N}.
Se você estiver migrando do Opus 4.6 ou anterior, aplique a migração do Opus 4.7 primeiro. É lá que residem as alterações disruptivas: remoção de amostragem, remoção de pensamento manual, alterações no tokenizador e migração de prefill.
Esforço e Pensamento
O Opus 4.8 usa pensamento adaptativo. O pensamento está desativado, a menos que você defina explicitamente thinking: {type: "adaptive"}. Uma vez ativado, o esforço torna-se o controle principal para a profundidade do pensamento e a propensão ao uso de ferramentas.
| Esforço | Use para | Risco |
|---|---|---|
low | Tarefas curtas, delimitadas e sensíveis à latência | Pode pensar menos do que o necessário em trabalhos moderadamente complexos |
medium | Tarefas de agente equilibradas e sensíveis ao custo | Precisa de avaliações antes de uma implementação ampla |
high | Padrão para tarefas sensíveis à qualidade | Maior uso de tokens do que níveis inferiores |
xhigh | Programação e trabalho agentic de longo prazo | Uso de tokens significativamente maior |
max | Problemas de fronteira com ganhos baseados em avaliações | Pode pensar demais e gastar recursos em excesso |
A recomendação prática da Anthropic é conservadora: comece com xhighpara programação e casos de uso agentic, use high para a maioria das outras cargas de trabalho sensíveis à inteligência, e reduza apenas quando as medições mostrarem que a qualidade se mantém.
Prompting 4.8
O Opus 4.8 é mais literal do que os modelos Opus mais antigos, especialmente em níveis de esforço mais baixos. Se uma instrução se aplica a cada item, diga isso. Se o modelo deve implementar em vez de sugerir, diga isso. Se uma ferramenta deve ser usada, explique quando e por quê. O guia de prompting é claro ao afirmar que prompts vagos são menos confiáveis do que escopo, formato de saída e exemplos explícitos.
Weak: Review these files and be conservative. Better: Find every issue that could cause incorrect behavior, a test failure, or a misleading result. Include low-confidence findings. Do not filter for severity in this pass; a later verification step will rank them.
Para trabalho de frontend, o guia oficial de prompting destaca um estilo padrão persistente: fundos off-white quentes, tipografia serifada para títulos e detalhes em âmbar ou terracota. Se esse estilo não se adequar ao produto, especifique uma direção visual concreta antes de gerar a UI.
System Messages
O Opus 4.8 aceita role: "system" entradas imediatamente após um turno do usuário no array messages, sujeito a regras de posicionamento. O caso de uso são loops agentic onde permissões, orçamentos de tokens, estado do ambiente ou instruções mudam no meio da tarefa. Você pode anexar uma nova instrução sem reconstruir todo o prompt e quebrar os hits de prompt-cache.
Mantenha o campo system de nível superior para instruções que se aplicam desde o início. Use system messages no meio da conversa para atualizações que ocorrem depois que o usuário já iniciou uma tarefa longa.
Prompt Cache
O Opus 4.8 reduz o comprimento mínimo de prompt armazenável em cache para 1.024 tokens. Esta é uma mudança de plataforma silenciosa, mas útil para agentes com system prompts de tamanho médio ou estado de harness. Prompts que eram muito curtos para serem armazenados em cache no Opus 4.7 agora podem criar entradas de cache sem alterações no código.
As velocidades Fast e standard não compartilham prefixos em cache na documentação do Claude Code. Se você alternar para o modo fast durante uma conversa, espere um cache miss e um custo de entrada não armazenado em cache mais elevado.
API do Fast Mode
A página de novidades do Opus 4.8 informa que o fast mode está disponível para o Claude Opus 4.8 como uma prévia de pesquisa na Claude API usando speed: "fast". O post de lançamento lista o fast mode do Opus 4.8 com 2.5x de velocidade de saída e US$ 10 de entrada / US$ 50 de saída por milhão de tokens.
Trate o fast mode como um produto de latência, não de inteligência. A documentação do Claude o descreve como o mesmo modelo com uma configuração de inferência mais rápida. Use-o quando o tempo de resposta for o gargalo e o custo adicional for justificado.
Harnesses de Code Review
O Opus 4.8 é melhor em encontrar bugs, mas a redação do prompt pode fazer com que um harness pareça perder recall. O guia de prompting explica o porquê: se o seu prompt de revisão diz "apenas relate problemas de alta severidade" ou "seja conservador", um modelo mais literal pode encontrar problemas e depois filtrá-los. Para uma revisão de primeira passagem, peça cobertura primeiro e classificação em segundo lugar.
Recommended first-pass review prompt: Report every issue you find, including uncertain or low-severity issues. Do not filter for importance or confidence at this stage. For each finding, include confidence and estimated severity. A downstream step will verify, deduplicate, and rank findings.
Checklist
- Substitua
claude-opus-4-7porclaude-opus-4-8. - Remova
temperature,top_p, etop_kque não sejam padrão. - Use
thinking: {type: "adaptive"}, nãobudget_tokensmanual. - Defina
output_config.effortexplicitamente para cargas de trabalho em produção. - Comece a programar agentes em
xhighe compare comhigh. - Remova os cabeçalhos beta de contexto de 1M antigos, já que o Opus 4.8 os torna desnecessários.
- Teste mensagens de sistema no meio da conversa em harnesses de longa execução.
- Reajuste a base do prompt caching, pois o mínimo agora é de 1.024 tokens.
- Execute novamente as avaliações para recall de revisão de código, uso de ferramentas, verbosidade e latência.
- Use
/claude-api migrateno Claude Code quando quiser que a skill integrada inspecione uma base de código.
FAQ
A migração do Opus 4.7 para o Opus 4.8 causa quebra de compatibilidade?
Não, desde que seu código já execute corretamente no Opus 4.7. O guia de migração do Claude afirma que não há alterações de API que quebrem a compatibilidade para códigos que já rodam no Claude Opus 4.7.
Os parâmetros temperature, top_p ou top_k funcionam no Opus 4.8?
Não. Parâmetros de amostragem não padrão retornam um erro 400 no Opus 4.8, assim como no Opus 4.7. Omita-os e utilize prompting e o parâmetro effort para direcionar o comportamento.
O Opus 4.8 suporta orçamentos de pensamento (thinking budgets) manuais?
Não. O Opus 4.8 não suporta thinking: {type: 'enabled', budget_tokens: N}. Utilize adaptive thinking e o parâmetro effort em vez disso.
Qual nível de effort devo usar para programação?
A Anthropic recomenda xhigh para programação e casos de uso de agentes, high para a maioria das outras cargas de trabalho que exigem inteligência, e níveis mais baixos apenas após medir a qualidade em suas próprias avaliações (evals).
O que mudou no prompt caching?
O comprimento mínimo de prompt passível de cache no Opus 4.8 é de 1.024 tokens, menor que no Opus 4.7. Alguns prompts que eram curtos demais para cache no 4.7 agora podem ser armazenados sem alterações no código.
Fontes Oficiais
- Documentação do Claude: Guia de migração
- Documentação do Claude: Melhores práticas de prompting
- Documentação do Claude: O que há de novo no Claude Opus 4.8
- Documentação do Claude: Parâmetro Effort
- Documentação do Claude: Visão geral dos modelos
- Anthropic: Apresentando o Claude Opus 4.8
Relacionado: a análise do lançamento do Opus 4.8 e o guia de fluxos de trabalho do Claude Code.
