Get the latest on AI, LLMs & developer tools
New MCP servers, model updates, and guides like this one — delivered weekly.
Resumen de la migración
La guía oficial de migración de Claude indica que el código que ya se ejecuta en Claude Opus 4.7 debería seguir funcionando en Opus 4.8 sin cambios que rompan la API. Eso no significa que debas cambiar a ciegas el ID del modelo en producción. Opus 4.8 recalibra el esfuerzo, utiliza por defecto un esfuerzo alto en todas partes, reduce el mínimo de prompt-cache y añade mensajes de sistema a mitad de la conversación.
Minimal migration: 1. Replace claude-opus-4-7 with claude-opus-4-8. 2. Keep adaptive thinking, not manual budget_tokens. 3. Keep sampling params omitted. 4. Re-baseline effort, latency, and cost. 5. Run your eval suite before production rollout.
ID del modelo
Uso claude-opus-4-8 en la API de Claude. La descripción general de los modelos enumera a Opus 4.8 como la mejor opción para razonamiento complejo, codificación agente de largo alcance y trabajo de alta autonomía. También documenta la ventana de contexto de 1M en la API de Claude, Bedrock y Vertex AI, con 200k en Microsoft Foundry.
import anthropic
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-4-8",
max_tokens=64000,
thinking={"type": "adaptive"},
output_config={"effort": "xhigh"},
messages=[
{"role": "user", "content": "Review this architecture migration plan."}
],
)Restricciones heredadas
Opus 4.8 hereda dos restricciones de Opus 4.7. Primero, no se admiten parámetros de muestreo que no sean los predeterminados. Si envías temperature, top_p, otop_k con valores distintos a los predeterminados, la API devuelve un error 400. Segundo, no se admiten presupuestos de pensamiento extendido manuales. No envíes thinking: {type: "enabled", budget_tokens: N}.
Si vas a migrar desde Opus 4.6 o versiones anteriores, aplica primero la migración a Opus 4.7. Ahí es donde se encuentran los cambios importantes: eliminación del muestreo, eliminación del pensamiento manual, cambios en el tokenizador y migración de prefill.
Esfuerzo y pensamiento
Opus 4.8 utiliza pensamiento adaptativo. El pensamiento está desactivado a menos que establezcas explícitamente thinking: {type: "adaptive"}. Una vez habilitado, el esfuerzo se convierte en el control principal para la profundidad del pensamiento y la disposición para el uso de herramientas.
| Esfuerzo | Úsalo para | Riesgo |
|---|---|---|
low | Tareas cortas, delimitadas y sensibles a la latencia | Puede pensar poco en trabajos moderadamente complejos |
medium | Tareas de agente equilibradas y sensibles al costo | Requiere evaluaciones antes de un despliegue general |
high | Predeterminado para tareas sensibles a la calidad | Mayor uso de tokens que en niveles inferiores |
xhigh | Programación y trabajo de agentes a largo plazo | Uso de tokens significativamente mayor |
max | Problemas de vanguardia con mejoras respaldadas por evaluaciones | Puede pensar demasiado y gastar en exceso |
La recomendación práctica de Anthropic es conservadora: comience con xhighpara programación y casos de uso de agentes, utilice high para la mayoría de las otras cargas de trabajo sensibles a la inteligencia, y reduzca el nivel solo cuando las mediciones demuestren que la calidad se mantiene.
Prompting 4.8
Opus 4.8 es más literal que los modelos Opus anteriores, especialmente en niveles de esfuerzo bajos. Si una instrucción se aplica a cada elemento, indíquelo. Si el modelo debe implementar en lugar de sugerir, indíquelo. Si se debe usar una herramienta, explique cuándo y por qué. La guía de prompting es clara al señalar que los prompts vagos son menos fiables que un alcance, formato de salida y ejemplos explícitos.
Weak: Review these files and be conservative. Better: Find every issue that could cause incorrect behavior, a test failure, or a misleading result. Include low-confidence findings. Do not filter for severity in this pass; a later verification step will rank them.
Para el trabajo de frontend, la guía oficial de prompting destaca un estilo predeterminado persistente: fondos blanquecinos cálidos, tipografía serif para títulos y acentos en color ámbar o terracota. Si ese estilo no se ajusta al producto, especifique una dirección visual concreta antes de generar la UI.
System Messages
Opus 4.8 acepta role: "system" entradas inmediatamente después de un turno de usuario en el array de mensajes, sujeto a reglas de ubicación. El caso de uso son los bucles de agentes donde los permisos, los presupuestos de tokens, el estado del entorno o las instrucciones cambian a mitad de la tarea. Puede añadir una nueva instrucción sin reconstruir todo el prompt y romper los aciertos de prompt-cache.
Mantenga el campo system de nivel superior para las instrucciones que se aplican desde el inicio. Utilice system messages a mitad de la conversación para actualizaciones que ocurran después de que el usuario ya haya comenzado una tarea larga.
Prompt Cache
Opus 4.8 reduce la longitud mínima de prompt almacenable en caché a 1,024 tokens. Este es un cambio de plataforma silencioso pero útil para agentes con system prompts de tamaño mediano o estado de arnés. Los prompts que eran demasiado cortos para almacenarse en caché en Opus 4.7 ahora pueden crear entradas de caché sin cambios en el código.
Las velocidades Fast y standard no comparten prefijos en caché en la documentación de Claude Code. Si cambias al modo fast a mitad de una conversación, espera un cache miss y un mayor costo de entrada no cacheada.
API de Fast Mode
La página de novedades de Opus 4.8 indica que el modo fast está disponible para Claude Opus 4.8 como una vista previa de investigación en la Claude API usando speed: "fast". La publicación de lanzamiento lista el modo fast de Opus 4.8 con una velocidad de salida 2.5x y un costo de $10 por entrada / $50 por salida por cada millón de tokens.
Considera el modo fast como un producto de latencia, no de inteligencia. La documentación de Claude lo describe como el mismo modelo con una configuración de inferencia más rápida. Úsalo cuando el tiempo de respuesta sea el cuello de botella y el costo adicional esté justificado.
Harnesses de revisión de código
Opus 4.8 es mejor detectando errores, pero la redacción del prompt puede hacer que un harness parezca perder recall. La guía de prompting explica por qué: si tu prompt de revisión dice "solo reporta problemas de alta severidad" o "sé conservador", un modelo más literal puede encontrar problemas y luego filtrarlos. Para una revisión de primera pasada, solicita cobertura primero y clasificación después.
Recommended first-pass review prompt: Report every issue you find, including uncertain or low-severity issues. Do not filter for importance or confidence at this stage. For each finding, include confidence and estimated severity. A downstream step will verify, deduplicate, and rank findings.
Lista de verificación
- Reemplaza
claude-opus-4-7conclaude-opus-4-8. - Elimina los
temperature,top_p, ytop_kque no sean los predeterminados. - Usa
thinking: {type: "adaptive"}, nobudget_tokensmanual. - Configura
output_config.effortexplícitamente para cargas de trabajo en producción. - Empieza a programar agentes en
xhighy compáralos conhigh. - Elimina los encabezados beta de contexto de 1M antiguos, ya que Opus 4.8 los hace innecesarios.
- Prueba los mensajes del sistema a mitad de la conversación en entornos de prueba de larga duración.
- Reajusta la caché de prompts, ya que el mínimo ahora es de 1,024 tokens.
- Vuelve a ejecutar las evaluaciones de recuperación de revisión de código, uso de herramientas, verbosidad y latencia.
- Usa
/claude-api migrateen Claude Code cuando quieras que la habilidad integrada inspeccione una base de código.
FAQ
¿La migración de Opus 4.7 a Opus 4.8 implica cambios disruptivos (breaking changes)?
No, siempre que tu código ya funcione correctamente en Opus 4.7. La guía de migración de Claude indica que no hay cambios disruptivos en la API para el código que ya funciona en Claude Opus 4.7.
¿Funcionan temperature, top_p o top_k en Opus 4.8?
No. Los parámetros de muestreo que no son predeterminados devuelven un error 400 en Opus 4.8, igual que en Opus 4.7. Omitelos y utiliza el prompting junto con el parámetro effort para dirigir el comportamiento.
¿Opus 4.8 admite presupuestos de pensamiento (thinking budgets) manuales?
No. Opus 4.8 no admite thinking: {type: 'enabled', budget_tokens: N}. Utiliza en su lugar el pensamiento adaptativo (adaptive thinking) y el parámetro effort.
¿Qué valor de effort debería usar para programación?
Anthropic recomienda xhigh para programación y casos de uso de agentes, high para la mayoría de las otras cargas de trabajo que requieren inteligencia, y niveles más bajos solo después de medir la calidad en tus propias evaluaciones (evals).
¿Qué ha cambiado en el almacenamiento en caché de prompts (prompt caching)?
La longitud mínima de prompt almacenable en caché en Opus 4.8 es de 1,024 tokens, menor que en Opus 4.7. Algunos prompts que eran demasiado cortos para almacenarse en caché en 4.7 ahora pueden hacerlo sin necesidad de realizar cambios en el código.
Fuentes oficiales
- Documentación de Claude: Guía de migración
- Documentación de Claude: Mejores prácticas de prompting
- Documentación de Claude: Novedades en Claude Opus 4.8
- Documentación de Claude: Parámetro Effort
- Documentación de Claude: Descripción general de modelos
- Anthropic: Presentación de Claude Opus 4.8
Relacionado: el desglose del lanzamiento de Opus 4.8 y la guía de flujos de trabajo de Claude Code.
