Briefing diario de herramientas AI para programadores — 23 de abril de 2026
v2.1.118 — Modo vim visual, /usage unificado y hooks que invocan MCP
La actualización más densa de la semana: modo visual vim (v y V) con operadores y feedback visual; /cost y /stats fusionados en /usage; los hooks ahora pueden invocar herramientas MCP directamente con type: "mcp_tool"; temas personalizados con nombre desde /theme; DISABLE_UPDATES bloquea todas las rutas de actualización; WSL hereda configuraciones gestionadas del lado Windows; /color sincroniza el color de acento con claude.ai/code cuando Remote Control está conectado.
v2.1.117 — bfs/ugrep nativos, /model persiste y plugins auto-instalados
Glob y Grep nativos reemplazados por bfs y ugrep embebidos para búsquedas más rápidas; las selecciones de /model persisten entre reinicios; inicio más rápido con conexiones MCP concurrentes; auto-instalación de dependencias de plugins desde marketplaces configurados; mejoras de OpenTelemetry con atributos de esfuerzo; subagentes bifurcados habilitables con CLAUDE_CODE_FORK_SUBAGENT=1.
v2.1.116 — /resume 67% más rápido en sesiones grandes y spinner con progreso
/resume en sesiones grandes (+40 MB) hasta un 67% más rápido; el spinner de pensamiento muestra progreso en línea (still thinking / thinking more / almost done thinking); la búsqueda en /config ahora coincide también con valores de opciones; la pestaña de uso muestra consumo inmediato de 5 horas y semanal; /reload-plugins auto-instala dependencias faltantes.
Lanzamiento de Claude Design — prototipos, slides y one-pagers con IA
Anthropic Labs lanzó Claude Design el 17 de abril: un producto experimental para quienes necesitan pasar de una idea a algo visual rápidamente sin arrancar desde una herramienta de diseño. Genera prototipos, slides, one-pagers y assets visuales; puede aplicar el design system de tu empresa leyendo el codebase y los archivos de diseño para mantener coherencia visual en cada proyecto.
Codex para (casi) todo — computer use, browser integrado, memoria y 90+ plugins
La actualización del 16 de abril redefine Codex de herramienta de desarrollo a workspace de propósito general: computer use en macOS (ve, hace clic, escribe en apps nativas), browser integrado para páginas locales y públicas sin login, generación de imágenes con gpt-image-1.5, memoria persistente en preview, automatizaciones programadas y más de 90 plugins nativos: GitHub PR, Slack, Notion, Google Workspace, GitLab, Atlassian Rovo, CircleCI, Render y más.
GPT-5.3-Codex-Spark — modelo de codificación en tiempo real a +1 000 TPS
Research preview del primer modelo OpenAI diseñado para codificación en tiempo real: más de 1 000 tokens por segundo manteniendo alta capacidad para tareas reales de código. Es la versión más pequeña de GPT-5.3-Codex y está disponible directamente en el CLI de Codex. Windows Sandbox recibió hardening de seguridad y se añadió autenticación con device code.
gpt-image-2 — generación de imágenes con razonamiento nativo y resolución 2K
Disponible vía API el 21 de abril, gpt-image-2 es el primer modelo de imagen de OpenAI con capacidades de razonamiento nativas. Genera hasta 8 imágenes coherentes por prompt con continuidad de personajes y objetos, soporta resolución 2K y ratios de aspecto de 3:1 a 1:3. Ideal para workflows de generación de contenido visual en lote.
Google Cloud Next 2026 — Vertex AI renombrado, protocolo A2A y MCP gestionado
El 22 de abril Google presentó su plataforma de agentes unificada: Vertex AI pasa a llamarse Gemini Enterprise Agent Platform y Google Agentspace se absorbe en Gemini Enterprise. Novedades clave para devs: constructor de agentes sin código para Workspace, plataforma con +200 modelos (incluido Claude de Anthropic), protocolo Agent2Agent (A2A) production-grade para comunicación cross-platform entre agentes, servidores MCP gestionados en todos los servicios de Google Cloud, y TPU generación 8 con ~3× más rendimiento computacional.
VS Code 2.78.0 y Gemini 3.1 Pro disponible en Code Assist (Preview)
La versión 2.78.0 del 16 de abril trae correcciones de bugs y mejoras menores. Simultáneamente, Gemini 3.1 Pro ya está disponible en preview dentro de Code Assist para VS Code e IntelliJ, habilitado para agent mode, chat y generación de código. La versión anterior 2.77.1 corrigió que los logs de agent mode se atribuían incorrectamente a Gemini CLI en lugar de Code Assist.
BYOK en VS Code y C++ Intelligence Preview para Business y Enterprise
Dos novedades del 22 de abril para planes Business/Enterprise: BYOK (Bring Your Own Key) permite aplicar claves propias de LLM directamente en VS Code para acceso a la API; C++ Intelligence Preview en el CLI añade soporte C++ vía el Language Server de Microsoft con tecnología IntelliSense de Visual Studio. También se actualizaron las métricas de Code Review para reportar conteos de usuarios activos/pasivos en la API empresarial.
Cambios en planes individuales — Opus eliminado de Pro, pausadas nuevas suscripciones
El 20 de abril GitHub reestructuró los planes Copilot individuales: nuevas suscripciones pausadas, límites de uso ajustados y modelos Opus ya no disponibles en planes Pro (solo Pro+). Claude Opus 4.7 está en rollout para Pro+, reemplazando a Opus 4.5 y 4.6 en el selector de modelos en las próximas semanas.
Auto Model Selection GA y nuevo comando gh skill para capacidades de agente
Disponible para todos los planes desde el 17 de abril: el CLI de Copilot selecciona automáticamente modelos eficientes según la tarea. Además, el nuevo comando gh skill (disponible desde el 16 de abril) permite descubrir e instalar capacidades de agente AI de codificación directamente desde el CLI de GitHub.
Línea de Tiempo — Lanzamientos de Modelos
| Fecha | Modelo | Proveedor | Tier | Tipo | Notas |
|---|---|---|---|---|---|
| 2026-04-21 | Kimi K2.6 | Moonshot AI | S+ | Abierto | 1T parámetros (32B activos, MoE). 58.6 SWE-bench Pro — #1 global. #1 HLE-Full (54.0). Swarm hasta 300 sub-agentes y 4 000 pasos coordinados. Disponible en Kimi.com, API y Ollama. MIT license. |
| 2026-04-21 | gpt-image-2 | OpenAI | A | Propietario | Primer modelo imagen OpenAI con razonamiento nativo. Hasta 8 imagenes coherentes/prompt. Resolucion 2K. Ratios 3:1 a 1:3. |
| 2026-04-20 | Qwen3.6-Max-Preview | Alibaba / Qwen | S | Propietario | #1 en SWE-bench Pro, Terminal-Bench 2.0, SkillsBench y 3 benchmarks mas. Contexto 260K. Primera vez que Alibaba lanza pesos cerrados. Solo API via dashscope/bailian. |
| 2026-04-16 | Claude Opus 4.7 | Anthropic | S+ | Propietario | 64.3% SWE-bench Pro (#1 global al lanzamiento). Nivel xhigh entre high y max. Vision 3x mayor resolucion. Precio $5/$25 por MTok. |
| 2026-04-16 | GPT-5.3-Codex-Spark | OpenAI | A | Propietario | Research preview. Optimizado para codificacion en tiempo real a +1 000 TPS. Variante mas pequeña de GPT-5.3-Codex. |
| 2026-04-09 | Mistral Medium 3 | Mistral | A | Abierto | Pesos abiertos. Apunta al espacio entre modelos locales pequeños y propietarios grandes. Fuerte en lenguas europeas y soporte nativo para metadatos EU AI Act. |
| 2026-04-07 | GLM-5.1 | Z.ai / Zhipu | S | Abierto | 754B MoE. 58.4 SWE-bench Pro (#1 global al lanzamiento de pesos el 7 abr). Loop autonomo plan-ejecutar-testear-corregir-optimizar hasta 8h. MIT license en Hugging Face. |
| 2026-04-02 | Gemma 4 | A | Abierto | Disponible en AICore Developer Preview para Android. Optimizado para uso en dispositivo. | |
| upcoming | DeepSeek V4 | DeepSeek | S | Próximo | Pronto. Optimizado para codificacion y software engineering con contexto largo. Tests internos (Reuters/The Information) superan a Claude y ChatGPT en tareas de codigo de larga duracion. |
Tendencias Destacadas
La semana del 16–23 de abril marca el pico de la ola de agentes de codificacion de largo horizonte: Kimi K2.6 (58.6 SWE-bench Pro), Qwen3.6-Max-Preview y GLM-5.1 se pelean el #1 global en dias alternos, todos superando a modelos propietarios. Tres labs chinos ahora ocupan el podio de la ingenieria de software autonoma.
Las plataformas de desarrollo convergen hacia runtimes de agentes unificados: Codex expandio a 90+ plugins con computer use; Google Cloud Next reemplazo Vertex AI por una plataforma de agentes con A2A y MCP gestionado; Claude Code ahora permite que los hooks invoquen herramientas MCP directamente. La distancia entre IDE y agente autonomo se cierra rapidamente.
Qwen3.6-Max-Preview representa un cambio estrategico significativo: Alibaba, historicamente defensor del open-source, lanzo por primera vez un flagship con pesos cerrados. Si DeepSeek V4 tambien llega de forma propietaria, el ecosistema open-weight chino que revoluciono los benchmarks en 2025 podria estar transitando a una fase mas comercial.
v2.1.118 — Vim visual mode, unified /usage, and hooks that invoke MCP tools
The week's densest drop: vim visual mode (v and V) with operators and visual feedback; /cost and /stats merged into /usage; Hooks can now invoke MCP tools directly via type: "mcp_tool"; create and switch named custom themes from /theme; DISABLE_UPDATES env var blocks all update paths; WSL on Windows inherits managed settings; /color syncs session accent to claude.ai/code when Remote Control is connected.
v2.1.117 — Native bfs/ugrep tools, /model persists across restarts, plugin auto-install
Native Glob/Grep replaced by embedded bfs and ugrep tools for faster searches; /model selections now persist across restarts; faster startup with concurrent MCP server connections; plugin dependency auto-installation from configured marketplaces; OpenTelemetry enhancements with effort attributes; forked subagents can be enabled with CLAUDE_CODE_FORK_SUBAGENT=1.
v2.1.116 — /resume 67% faster on large sessions, thinking spinner with inline progress
/resume on large sessions (40 MB+) is up to 67% faster; the thinking spinner now shows inline progress (still thinking / thinking more / almost done thinking); /config search now matches option values; usage tab shows immediate 5-hour and weekly usage; /reload-plugins auto-installs missing dependencies.
Claude Design launches — prototypes, slides, and one-pagers powered by AI
Anthropic Labs launched Claude Design on April 17 — an experimental product for people who need to go from an idea to something visual quickly without starting from a design tool. It generates prototypes, slides, one-pagers, and visual assets, and can apply your team's design system by reading your codebase and design files for visual consistency across every project.
Codex for (almost) everything — computer use, in-app browser, memory preview, and 90+ plugins
The April 16 update reshapes Codex from a developer-only tool into a general-purpose AI workspace: computer use on macOS (see, click, type in native apps), in-app browser for local and public pages without sign-in, image generation via gpt-image-1.5, persistent memory preview, scheduled automations, and 90+ native plugins: GitHub PR, Slack, Notion, Google Workspace, GitLab, Atlassian Rovo, CircleCI, Render, and more.
GPT-5.3-Codex-Spark — real-time coding model delivering 1,000+ tokens/second
Research preview of the first OpenAI model designed for real-time coding: over 1,000 tokens per second while remaining highly capable for real-world coding tasks. It is a smaller variant of GPT-5.3-Codex and is available directly in the Codex CLI. Windows sandbox received security hardening and device code authentication was added.
gpt-image-2 — native-reasoning image generation, 2K resolution, 8-image batches
Available via API on April 21, gpt-image-2 is OpenAI's first image model with native reasoning capabilities. Generates up to 8 coherent images from a single prompt with character and object continuity across the batch, supports 2K resolution and aspect ratios from 3:1 to 1:3. Ideal for batch visual content generation workflows.
Google Cloud Next 2026 — Vertex AI rebranded to Gemini Enterprise, A2A protocol, managed MCP
On April 22, Google unveiled its unified agent platform: Vertex AI is now the Gemini Enterprise Agent Platform, and Google Agentspace is absorbed into Gemini Enterprise. Key developer additions: no-code agent builder for Workspace, a developer platform with 200+ models (including Anthropic's Claude), production-grade Agent2Agent (A2A) protocol for cross-platform agent communication, managed MCP servers across all Google Cloud services, and 8th-gen TPUs with ~3× higher compute performance.
VS Code 2.78.0 and Gemini 3.1 Pro now available in Code Assist (Preview)
Version 2.78.0 (April 16) brings various bug fixes and minor enhancements. Alongside this, Gemini 3.1 Pro is now available in Preview inside Code Assist for VS Code and IntelliJ, enabled for agent mode, chat, and code generation. The prior 2.77.1 release fixed agent mode logs being incorrectly attributed to Gemini CLI instead of Code Assist.
BYOK in VS Code and C++ Intelligence Preview for Business and Enterprise plans
Two April 22 additions for Business and Enterprise plans: BYOK (Bring Your Own Key) lets users apply their own language model keys directly in VS Code for API access; C++ Intelligence Preview in the CLI adds C++ support via Microsoft's Language Server with IntelliSense technology from Visual Studio. Copilot Code Review Metrics API also updated with aggregated active and passive user counts for enterprise reporting.
Individual plan changes — Opus removed from Pro, new sign-ups paused, limits tightened
On April 20, GitHub restructured individual Copilot plans: new sign-ups were paused, usage limits were tightened, and Opus models are no longer available in Pro plans — Pro+ only. Claude Opus 4.7 is rolling out to Pro+ over the coming weeks, replacing Opus 4.5 and 4.6 in the model picker.
Auto Model Selection goes GA and new gh skill command for agent capabilities
Available across all plans since April 17: the Copilot CLI automatically selects efficient models based on the task, reducing cost without sacrificing quality. Additionally, the new gh skill command (available since April 16) lets developers discover and install AI coding agent capabilities directly from the GitHub CLI.
Model Launches Timeline
| Date | Model | Provider | Tier | Type | Notes |
|---|---|---|---|---|---|
| 2026-04-21 | Kimi K2.6 | Moonshot AI | S+ | Open | 1T params (32B active, MoE). 58.6 SWE-bench Pro — #1 global. #1 HLE-Full (54.0). Swarm up to 300 sub-agents and 4,000 coordinated steps. Available on Kimi.com, API, and Ollama. MIT license. |
| 2026-04-21 | gpt-image-2 | OpenAI | A | Proprietary | First OpenAI image model with native reasoning. Up to 8 coherent images per prompt. 2K resolution. Aspect ratios 3:1 to 1:3. |
| 2026-04-20 | Qwen3.6-Max-Preview | Alibaba / Qwen | S | Proprietary | #1 on SWE-bench Pro, Terminal-Bench 2.0, SkillsBench, and 3 more benchmarks. 260K context. First-ever closed-weights release from Alibaba. API-only via dashscope/bailian. |
| 2026-04-16 | Claude Opus 4.7 | Anthropic | S+ | Proprietary | 64.3% SWE-bench Pro (#1 global at launch). xhigh effort level between high and max. 3x higher resolution vision. Pricing $5/$25 per MTok. |
| 2026-04-16 | GPT-5.3-Codex-Spark | OpenAI | A | Proprietary | Research preview. Optimized for real-time coding at 1,000+ TPS. Smaller variant of GPT-5.3-Codex. |
| 2026-04-09 | Mistral Medium 3 | Mistral | A | Open | Open weights. Targets the gap between small local models and large proprietary ones. Strong on European languages with built-in EU AI Act compliance metadata. |
| 2026-04-07 | GLM-5.1 | Z.ai / Zhipu | S | Open | 754B MoE. 58.4 SWE-bench Pro (#1 global at weights release on Apr 7). Autonomous plan-execute-test-fix-optimize loop up to 8 hours. MIT license on Hugging Face. |
| 2026-04-02 | Gemma 4 | A | Open | Available in AICore Developer Preview for Android. Optimized for on-device use. | |
| upcoming | DeepSeek V4 | DeepSeek | S | Upcoming | Coming soon. Optimized for coding and long-context software engineering. Internal tests per Reuters/The Information reportedly outperform Claude and ChatGPT on long-context coding tasks. |
Notable Trends
The week of April 16-23 marks the peak of the long-horizon coding agent wave: Kimi K2.6 (58.6 SWE-bench Pro), Qwen3.6-Max-Preview, and GLM-5.1 trade the #1 global spot within days of each other, all surpassing proprietary models. Three Chinese labs now occupy the top of the autonomous software engineering rankings.
Developer platforms are converging toward unified agent runtimes: Codex expanded to 90+ plugins with computer use; Google Cloud Next replaced Vertex AI with an agent platform featuring A2A and managed MCP; Claude Code now lets Hooks invoke MCP tools directly. The gap between IDE and autonomous agent is closing fast.
Qwen3.6-Max-Preview marks a significant strategic shift: Alibaba, historically a champion of open-source AI, shipped a flagship closed-weights for the first time ever. If DeepSeek V4 also arrives proprietary, the Chinese open-weight ecosystem that disrupted benchmarks throughout 2025 may be entering a more commercial phase.
v2.1.118 — Mode vim visuel, /usage unifié et hooks invoquant les outils MCP
La mise à jour la plus dense de la semaine : mode visuel vim (v et V) avec opérateurs et feedback visuel ; /cost et /stats fusionnés dans /usage ; les hooks peuvent désormais invoquer des outils MCP via type: "mcp_tool" ; thèmes personnalisés nommés depuis /theme ; DISABLE_UPDATES bloque toutes les mises à jour ; WSL hérite des paramètres gérés côté Windows.
v2.1.117 — Outils bfs/ugrep natifs, /model persistant, plugins auto-installés
Glob/Grep natifs remplacés par bfs et ugrep embarqués ; les sélections /model persistent entre redémarrages ; démarrage plus rapide avec connexions MCP concurrentes ; auto-installation des dépendances de plugins ; améliorations OpenTelemetry avec attributs d'effort.
v2.1.116 — /resume 67% plus rapide sur les grandes sessions, indicateur avec progression
/resume sur de grandes sessions (40 Mo+) jusqu'à 67% plus rapide ; l'indicateur de réflexion affiche désormais la progression en ligne (still thinking / thinking more / almost done) ; la recherche /config correspond aux valeurs d'options ; /reload-plugins auto-installe les dépendances manquantes.
Lancement de Claude Design — prototypes, slides et one-pagers propulsés par l'IA
Anthropic Labs a lancé Claude Design le 17 avril — un produit expérimental pour passer rapidement d'une idée à une création visuelle sans partir d'un outil de design. Il génère prototypes, slides, one-pagers et assets visuels, et peut appliquer le design system de votre équipe en lisant votre codebase et vos fichiers de design.
Codex pour (presque) tout — computer use, navigateur intégré, mémoire et 90+ plugins
La mise à jour du 16 avril transforme Codex en workspace IA polyvalent : computer use sur macOS, navigateur intégré pour pages locales et publiques sans connexion, génération d'images via gpt-image-1.5, mémoire persistante en preview, automatisations planifiées et 90+ plugins natifs : GitHub PR, Slack, Notion, Google Workspace, GitLab, Atlassian, CircleCI, Render.
GPT-5.3-Codex-Spark — modèle de codage en temps réel à +1 000 TPS
Preview de recherche du premier modèle OpenAI conçu pour le codage en temps réel : plus de 1 000 tokens par seconde tout en restant performant sur des tâches de code réelles. Variante plus petite de GPT-5.3-Codex, disponible directement dans le CLI Codex.
gpt-image-2 — génération d'images avec raisonnement natif, résolution 2K
Disponible via API le 21 avril, gpt-image-2 est le premier modèle image d'OpenAI avec des capacités de raisonnement natif. Génère jusqu'à 8 images cohérentes par prompt avec continuité des personnages et objets, supporte la résolution 2K et des ratios de 3:1 à 1:3.
Google Cloud Next 2026 — Vertex AI rebaptisé Gemini Enterprise, protocole A2A, MCP géré
Le 22 avril, Google a dévoilé sa plateforme d'agents unifiée : Vertex AI devient la Gemini Enterprise Agent Platform, Google Agentspace est absorbé dans Gemini Enterprise. Nouveautés clés pour les devs : constructeur d'agents sans code pour Workspace, protocole A2A production pour la communication cross-plateforme, serveurs MCP gérés sur tous les services Google Cloud, et TPU de 8e génération avec ~3× de performance.
VS Code 2.78.0 et Gemini 3.1 Pro disponible dans Code Assist (Preview)
La version 2.78.0 (16 avril) apporte diverses corrections de bogues. En parallèle, Gemini 3.1 Pro est désormais disponible en Preview dans Code Assist pour VS Code et IntelliJ, activé pour le mode agent, le chat et la génération de code. La version 2.77.1 avait corrigé l'attribution incorrecte des logs du mode agent à Gemini CLI.
BYOK dans VS Code et C++ Intelligence Preview pour Business et Enterprise
Deux ajouts du 22 avril pour les plans Business et Enterprise : BYOK permet d'utiliser ses propres clés LLM directement dans VS Code ; C++ Intelligence Preview dans le CLI ajoute le support C++ via le Language Server de Microsoft avec la technologie IntelliSense. L'API des métriques de Code Review a été mise à jour avec les comptages d'utilisateurs actifs/passifs.
Changements de plans individuels — Opus retiré de Pro, nouvelles inscriptions suspendues
Le 20 avril, GitHub a restructuré les plans Copilot individuels : nouvelles inscriptions suspendues, limites d'utilisation resserrées, et les modèles Opus ne sont plus disponibles dans les plans Pro (Pro+ seulement). Claude Opus 4.7 arrive sur Pro+ dans les semaines à venir.
Auto Model Selection en GA et nouvelle commande gh skill pour les capacités d'agent
Disponible pour tous les plans depuis le 17 avril : le CLI de Copilot sélectionne automatiquement des modèles efficaces selon la tâche. La nouvelle commande gh skill (depuis le 16 avril) permet de découvrir et d'installer des capacités d'agent AI de codage directement depuis le CLI GitHub.
Chronologie des Lancements de Modèles
| Date | Modèle | Fournisseur | Tier | Type | Notes |
|---|---|---|---|---|---|
| 2026-04-21 | Kimi K2.6 | Moonshot AI | S+ | Ouvert | 1T params (32B actifs, MoE). 58.6 SWE-bench Pro — #1 mondial. #1 HLE-Full (54.0). Essaim jusqu'a 300 sous-agents et 4 000 etapes coordonnees. Disponible sur Kimi.com, API et Ollama. Licence MIT. |
| 2026-04-21 | gpt-image-2 | OpenAI | A | Propriétaire | Premier modele image OpenAI avec raisonnement natif. Jusqu'a 8 images coherentes par prompt. Resolution 2K. Ratios 3:1 a 1:3. |
| 2026-04-20 | Qwen3.6-Max-Preview | Alibaba / Qwen | S | Propriétaire | #1 sur SWE-bench Pro, Terminal-Bench 2.0, SkillsBench et 3 autres. Contexte 260K. Premiere version a poids fermes chez Alibaba. API uniquement via dashscope/bailian. |
| 2026-04-16 | Claude Opus 4.7 | Anthropic | S+ | Propriétaire | 64.3% SWE-bench Pro (#1 mondial au lancement). Niveau d'effort xhigh entre high et max. Vision 3x plus haute resolution. Tarif $5/$25 par MTok. |
| 2026-04-16 | GPT-5.3-Codex-Spark | OpenAI | A | Propriétaire | Preview de recherche. Optimise pour le codage en temps reel a +1 000 TPS. Variante plus petite de GPT-5.3-Codex. |
| 2026-04-09 | Mistral Medium 3 | Mistral | A | Ouvert | Poids ouverts. Cible l'espace entre petits modeles locaux et grands modeles proprietaires. Fort sur les langues europeennes avec metadonnees EU AI Act integrees. |
| 2026-04-07 | GLM-5.1 | Z.ai / Zhipu | S | Ouvert | 754B MoE. 58.4 SWE-bench Pro (#1 mondial a la publication des poids le 7 avr). Boucle autonome plan-executer-tester-corriger-optimiser jusqu'a 8h. Licence MIT sur Hugging Face. |
| 2026-04-02 | Gemma 4 | A | Ouvert | Disponible dans l'AICore Developer Preview pour Android. Optimise pour une utilisation on-device. | |
| upcoming | DeepSeek V4 | DeepSeek | S | À venir | Bientot. Optimise pour le codage et l'ingenierie logicielle long-contexte. Tests internes (Reuters/The Information) depasseraient Claude et ChatGPT sur les taches de code longues. |
Tendances Notables
La semaine du 16–23 avril marque le pic de la vague des agents de codage long-horizon : Kimi K2.6 (58.6 SWE-bench Pro), Qwen3.6-Max-Preview et GLM-5.1 s'echangent la premiere place mondiale en quelques jours, tous surpassant les modeles proprietaires. Trois labs chinois occupent desormais le podium.
Les plateformes de developpement convergent vers des runtimes d'agents unifies : Codex etendu a 90+ plugins avec computer use ; Google Cloud Next a remplace Vertex AI par une plateforme d'agents avec A2A et MCP gere ; Claude Code permet aux hooks d'invoquer des outils MCP directement.
Qwen3.6-Max-Preview marque un changement strategique majeur : Alibaba, historiquement champion de l'open-source, a lance un modele phare a poids fermes pour la premiere fois. Si DeepSeek V4 suit la meme voie, l'ecosysteme open-weight chinois qui a bouleverse les benchmarks en 2025 pourrait entrer dans une phase plus commerciale.