Lo que sale en IA, filtrado por una pregunta: ¿esto cambia lo que alguien puede hacer hoy? Si la respuesta es no, no entra.
Cada entrada lleva el enlace a la fuente oficial —no a la nota que la comenta— y una evaluación propia. Cuando algo no se probó de primera mano, se dice.
Claude Opus 5
26 de julio de 2026 · Anthropic
Modelo orientado a trabajo agéntico de larga duración: tareas de varios pasos que se sostienen en el tiempo en lugar de una respuesta y listo. Lo distintivo no es el puntaje en evaluaciones sino que el agente administra parte de su propia memoria: trata su contexto como un documento vivo, corrige sus propias suposiciones cuando la realidad las contradice, y retira lo que dejó de servirle.
Precio: desde 5 USD por millón de tokens de entrada y 25 por millón de salida, con hasta 90% de ahorro usando caché de prompt y 50% en procesamiento por lotes.
Nuestra evaluación
El dato que importa para quien construye no es el benchmark: es el caché de prompt al 90%. En un agente que corre muchas veces sobre el mismo contexto, esa diferencia decide si un proyecto es viable o no. Un flujo que reusa contexto puede costar un orden de magnitud menos que uno que lo reconstruye cada vez.
Sobre la memoria autoadministrada: es la capacidad más interesante y también la más fácil de sobrevender. Que un agente corrija su propia suposición es valioso si además deja rastro de que la corrigió. Sin ese rastro, un agente que cambia de opinión solo es un agente cuyo estado no se puede auditar.
Qué mirar antes de adoptarlo: el system card. Es el documento donde están las limitaciones, y es el que casi nadie abre.
DeepSeek V4
Abril de 2026 · DeepSeek · pesos abiertos, licencia MIT
Dos variantes con arquitectura de expertos: V4-Pro (1,6 billones de parámetros totales, 49 mil millones activos por token) y V4-Flash (284 mil millones totales, 13 mil millones activos). Pesos publicados bajo licencia MIT, de las más permisivas que existen para modelos de este tamaño.
Contexto de 1 millón de tokens, y compatibilidad de API tanto con el formato de OpenAI como con el de Anthropic.
Nuestra evaluación
"Pesos abiertos" no significa "lo podés correr". Ni siquiera la variante Flash entra en una máquina normal: 284 B de parámetros necesitan cientos de gigas de memoria, muy por encima de cualquier equipo de escritorio. Para quien quiera usarlo en serio, la vía realista es la API o un proveedor de inferencia, no el hardware propio.
Lo que sí importa acá es la licencia MIT y la compatibilidad de API. Juntas significan que se puede migrar código escrito para OpenAI o Anthropic sin reescribirlo, y que no hay una cláusula de uso que sorprenda después. Eso vale más que el conteo de parámetros para quien construye sobre esto.
No lo probamos. Los números son del anuncio y la model card oficiales.
Un dato que dejamos fuera. Circula una cifra de "685 mil millones de parámetros en total" para esta familia, pero no cuadra con ninguna de las dos variantes anunciadas (1,6 billones y 284 mil millones) — parece heredada de la generación anterior. Preferimos omitirla antes que repetir un número que no cierra.
Qwen 3.6
Abril de 2026 · Alibaba · pesos abiertos en Hugging Face y ModelScope
Familia con foco en codificación agéntica: flujos de front-end y razonamiento a nivel de repositorio completo, no de archivo suelto. La característica más interesante es "thinking preservation" — el modelo conserva su contexto de razonamiento entre turnos de la conversación, en vez de reconstruirlo cada vez.
Variantes abiertas relevantes: Qwen3.6-27B y Qwen3.6-35B-A3B (esta última de expertos, con solo 3 B de parámetros activos por token).
Nuestra evaluación
Este sí es aterrizable en hardware propio, y esa es toda la diferencia con el anterior. La variante 35B-A3B es la más interesante para un equipo de escritorio: al ser de expertos activa apenas 3 B de parámetros por token, así que corre mucho más rápido de lo que su tamaño total sugiere. La 27B densa es más predecible pero pide más de la máquina en cada token.
Sobre thinking preservation: si funciona como se describe, ataca un costo real y poco discutido — en un agente que itera sobre la misma tarea, reconstruir el razonamiento en cada turno es trabajo pagado dos veces. Es el mismo tipo de ahorro que el caché de prompt, por otra vía.
Nota de fechas: es de abril, no de esta semana. Entra igual porque para quien corre modelos en su propia máquina sigue siendo la opción más relevante, y eso no caduca con el ciclo de noticias.
No lo probamos todavía.
Cómo se arma este radar
Fuente primaria o no entra. Se enlaza el anuncio del fabricante, el repo o la documentación — no un artículo que los resume. Si algo solo existe en agregadores, espera.
La evaluación es propia y puede estar equivocada. Se dice qué se probó y qué no. "No lo probamos todavía" es una respuesta válida y aparece cuando corresponde.
Si no hay nada que valga, no hay entrada. Un radar que publica por calendario en lugar de por hallazgo se vuelve ruido, y el ruido es exactamente lo que este espacio intenta filtrar.