Opus 5.5 ya está aquí. No lo usamos para todo.
La familia Claude 5 volvió a subir el techo. En Digitals AI Labs la regla sigue igual: cada tarea se queda con el modelo más barato que la resuelve bien. Así repartimos el trabajo entre Opus 5.5, Sonnet y Haiku 4.5.
Cada lanzamiento trae la misma tentación: pasar todo al modelo nuevo. Con Claude Opus 5.5 la tentación es más fuerte que nunca, porque el salto se nota. Y aun así, en el Lab no lo usamos para todo.
La regla del Lab
Cada llamada a un modelo queda registrada por subcuenta dentro de Hapee: qué tarea, qué modelo y cuánto costó. Con ese registro la discusión deja de ser de gustos. La regla es simple: Haiku donde basta, Sonnet donde el razonamiento paga, Opus donde el trabajo es largo y difícil de verdad, y nunca un modelo más caro solo porque es nuevo.
Haiku 4.5: el que trabaja todo el día
En el módulo de licitaciones de Hapee, Claude Haiku 4.5 lee cada licitación nueva de Mercado Público y calcula su afinidad con la agencia y con cada cliente en una sola pasada diaria. Un solo análisis sirve a todas las subcuentas: el costo de IA queda en el orden de US$3–4 al mes por agencia, no por cliente.
Haiku también responde el chat de los agentes en hapee.ai y en la oficina 3D de Hapee. Son tareas repetidas, a escala y con respuesta rápida: ahí un modelo más grande solo agrega costo.
Sonnet: donde pensar más paga
Las propuestas y el análisis de bases técnicas de licitaciones van a Sonnet. Son documentos largos, con requisitos cruzados y letra chica, donde un error cuesta mucho más que la llamada.
Opus 5.5: el trabajo largo
Opus 5.5 entra cuando la tarea dura horas y tiene muchas piezas: desarrollo con Claude Code, auditorías técnicas y optimizaciones que exigen leer mucho código antes de tocar una línea. Esta misma semana la oficina 3D de Hapee ganó definición en monitores comunes y sus robots cambiaron de cara, y este editorial también se construye así. En ese tipo de trabajo el modelo más capaz no es un lujo: ahorra días.
Lo que no cambia con cada modelo
- Medir el costo por tarea, no por mes. Si no sabes cuánto cuesta cada llamada, no puedes elegir.
- Probar primero sin RAG. En nuestras pruebas, 7 de cada 10 casos de clientes caben completos en el contexto del modelo. RAG se suma cuando el tamaño o el costo lo piden.
- Un modelo nuevo se gana su lugar tarea por tarea, con los mismos casos de prueba que el anterior.
La familia Claude 5 es la mejor que hemos tenido en las manos. Justamente por eso vale la pena usarla con criterio. La bitácora completa del Lab está en Digitals AI Labs.