Informe diario de herramientas IA — 7 de mayo de 2026
Carga de plugins por URL + auto-actualización de gestor de paquetes
v2.1.129 agrega el flag --plugin-url <url> para cargar un plugin .zip desde una URL para la sesión actual. Con CLAUDE_CODE_PACKAGE_MANAGER_AUTO_UPDATE activo en instalaciones Homebrew o WinGet, Claude Code ejecuta el upgrade en segundo plano y propone reiniciar.
MCP auto-reintento al inicio + protección de carpeta de skills
Los servidores MCP con errores transitorios al iniciar ahora reintentarán hasta 3 veces automáticamente en lugar de quedarse desconectados. Además, --dangerously-skip-permissions ya no solicita confirmación para escrituras en .claude/skills/, .claude/agents/ ni .claude/commands/.
Soporte de archivos .zip en plugins + mejoras al comando /mcp
v2.1.128 expande el soporte de plugins con manejo de archivos .zip y mejora el comando /mcp para mostrar el conteo de herramientas de cada servidor conectado. Los subprocesos ya no heredan variables OTEL_*.
Comando claude project purge + historial Ctrl+R global restaurado
v2.1.126 introduce claude project purge para limpiar el estado del proyecto. El selector de historial con Ctrl+R fue restaurado para buscar todos los prompts de todos los proyectos por defecto. También mejorado el login OAuth para entornos donde el callback no puede alcanzar localhost.
Fix: activación VS Code en Windows + autenticación Mantle
v2.1.131 corrige el fallo de activación de la extensión VS Code en Windows causado por una ruta de build hardcodeada, y resuelve el header x-api-key faltante en la autenticación del endpoint Mantle.
Multiagent Sessions y Outcomes pasan a beta pública
La plataforma de desarrolladores de Claude lanzó Multiagent Sessions y Outcomes en beta pública. Se agregó soporte de webhooks para Claude Managed Agents y refresco de credenciales en segundo plano para MCP OAuth. Las opciones de filtrado y ordenado de sesiones y eventos también fueron expandidas.
Feature 'dreaming': memoria auto-mejorable de agentes en preview
Claude presentó el feature dreaming en research preview, que permite a los agentes mejorar su propia memoria entre sesiones de forma autónoma. También se publicaron webhooks para notificaciones de finalización de tareas de agentes.
Límites de uso duplicados + acuerdo de cómputo con SpaceX (220K GPUs)
Anthropic duplicó los límites de tasa de Claude Code para los planes Pro, Max, Team y Enterprise, eliminó las reducciones de horas pico para Pro y Max, y elevó sustancialmente los límites de API de Claude Opus. El acuerdo con SpaceX suma más de 300 MW de capacidad de cómputo y más de 220.000 GPUs NVIDIA.
10 agentes financieros pre-built + add-ins para Microsoft 365 GA
Anthropic lanzó 10 plantillas de agentes financieros listas para usar (análisis de crédito, KYC, pitchbooks, análisis de resultados, suscripción, cierre mensual, auditoría de estados y reclamaciones de seguros) y puso en disponibilidad general los add-ins de Claude para Excel, PowerPoint y Word. El add-in para Outlook llega próximamente. Se suman 8 nuevos conectores de datos incluyendo Dun & Bradstreet y Moody's MCP.
Claude Security pasa a beta pública para Enterprise
Claude Security, el sistema de escaneo de vulnerabilidades de Anthropic, pasó a beta pública para clientes Enterprise. Incluye escaneo programado y dirigido de vulnerabilidades, con integración de webhooks para Slack y Jira.
Codex 0.128: workflows /goal persistentes, MultiAgentV2 y plugins de marketplace
La versión 0.128.0 agrega workflows /goal persistentes con controles TUI (crear, pausar, reanudar, limpiar) y APIs de app-server. Los perfiles de permisos fueron expandidos con defaults integrados y selección de perfil sandbox desde CLI. La gestión de plugins ahora soporta instalación desde marketplace remoto y cacheo de bundles. Configuración de MultiAgentV2 con límites de threads y tiempos de espera, más correcciones de estabilidad en Windows y soporte Bedrock.
VS Code v1.116–v1.119: búsqueda semántica en repos + Chronicle experimental
Las versiones de abril-mayo agregan indexación semántica para buscar por significado en cualquier workspace y ejecutar queries tipo grep en repos y organizaciones de GitHub. Chronicle (experimental) registra el historial de chat en una base de datos local para buscar sesiones pasadas. Los agentes ahora pueden leer y escribir en terminales abiertas y acceder a pestañas del navegador en tiempo real. Las notificaciones del sistema avisan sobre comandos de terminal de larga duración.
BYOK extendido a Business y Enterprise + CLI 1.0.41 más rápido
Los planes Copilot Business y Enterprise ahora pueden vincular sus propias claves API para usar modelos directamente en VS Code chat. La CLI 1.0.41 (5 mayo) inicia más rápido renderizando la UI de inmediato mientras la autenticación se resuelve en segundo plano; las completions de shell se instalan automáticamente en el primer uso.
Plugins gestionados por la empresa en Copilot CLI → preview pública
Las organizaciones ahora pueden gestionar plugins personalizados para sus despliegues de Copilot CLI en public preview, dando a los equipos de IT control sobre qué extensiones están disponibles para sus desarrolladores.
Aviso de deprecación: GPT-5.2 y GPT-5.2-Codex dejan de estar disponibles en Copilot
GitHub anunció que GPT-5.2 y GPT-5.2-Codex dejarán de estar disponibles en Copilot. Los usuarios que tengan configuraciones que especifiquen estos modelos explícitamente deben migrar a versiones más recientes.
Línea de Tiempo — Lanzamientos de Modelos
| Fecha | Modelo | Proveedor | Tier | Tipo | Notas |
|---|---|---|---|---|---|
| 2026-04-23 | GPT-5.5 Instant | OpenAI | S+ | Propietario | Nuevo modelo por defecto de ChatGPT (reemplaza GPT-5.3 Instant). 82.7% en Terminal-Bench 2.0. Mejor en flujos de terminal complejos, resolución de issues reales de GitHub y tareas de codificación de larga duración. |
| 2026-04-22 | Qwen3.6-27B | Alibaba / Qwen | A+ | Abierto | 27B parámetros, Apache 2.0. Supera al MoE Qwen3.5-397B-A17B en benchmarks de coding agentico. SWE-bench Verified: 77.2%. Arquitectura híbrida con atención lineal Gated DeltaNet y mecanismo Thinking Preservation. |
| 2026-04-20 | Kimi K2.6 | Moonshot AI | A+ | Abierto | 1T parámetros MoE (32B activos), Modified MIT. Essaim de agentes: hasta 300 sub-agentes especializados y 4.000 pasos coordinados (3x más que K2.5). Multimodal nativo. Disponible en API, Kimi.com y Kimi Code CLI. |
| 2026-04-16 | Claude Opus 4.7 | Anthropic | S+ | Propietario | 64.3% SWE-bench Pro (#1 global). 87.6% SWE-bench Verified. Resolución de imágenes 3x mejorada. Nuevo nivel de esfuerzo xhigh (entre high y max). $5/$25 por MTok entrada/salida. |
| 2026-04-16 | Qwen3.6-35B-A3B | Alibaba / Qwen | A | Abierto | 35B parámetros MoE (3B activos), Apache 2.0. Primer modelo de la serie Qwen3.6. Inferencia eficiente con activación mínima de parámetros. |
| 2026-04-08 | GLM-5.1 | Z.ai (Zhipu) | A | Abierto | 754B parámetros MoE, open-source (Apache 2.0). Orientado a ingeniería agentica y tareas de codificación de larga duración. Preview para suscriptores desde finales de marzo; open-source el 8 de abril. |
| 2026-04 | DeepSeek V4 | DeepSeek | S | Abierto | Salto arquitectónico para contexto ultra-largo en producción. Entrenado en +32T tokens. Ventana de contexto nativa de 1M tokens. $0.14/MTok — la opción más económica del tier S. |
| 2026-04 | Gemini 2.5 Pro | S | Propietario | GA. Impulsa Gemini Code Assist Standard y Enterprise. Ventana de contexto de 2M tokens disponible en Vertex AI. Gemini 2.0 retira el 1 de junio de 2026. | |
| 2026-03 | Claude Sonnet 4.6 | Anthropic | S | Propietario | Modelo de producción actual de Anthropic (ID: claude-sonnet-4-6). Ventana de contexto de 1M tokens disponible de forma general desde el 13 de marzo sin cargo adicional por contexto largo. |
| 2026-05 | Claude Mythos | Anthropic | S+ | Próximo | Modelo orientado a ciberseguridad en pruebas internas y rollout limitado. Revelado por filtración de datos en marzo 2026. Representa un 'cambio de escala' en capacidades según Fortune. |
| 2026-05 | Jupiter-v1-p | Anthropic | S | Próximo | En pruebas internas antes de un posible lanzamiento en mayo 2026. Detalles de capacidades aún no revelados. |
| 2026-05 | Gemini 3.1 Ultra | S+ | Próximo | Esperado para Google I/O 2026 (19-20 mayo). Contexto de 2M tokens. 94.3% en GPQA Diamond. Google retira Gemini 2.0 (fin de vida: 1 jun 2026) para empujar la familia Gemini 3.x como nueva base. |
Tendencias Destacadas
El computing agentico domina la semana: Claude lanzó Multiagent Sessions en beta pública y el feature de memoria auto-mejorable de agentes, Codex 0.128 persistió workflows /goal con TUI completo, y Copilot extendió a sus agentes acceso a terminales activas y pestañas del navegador. Cada plataforma compite por ofrecer la orquestación de agentes más autónoma.
La infraestructura de cómputo escala agresivamente: Anthropic firmó un acuerdo con SpaceX que suma 300+ MW y 220.000+ GPUs NVIDIA, al tiempo que duplicó los límites de tasa para todos los planes de pago. La capacidad de cómputo está dejando de ser el cuello de botella para las cargas de producción.
Los modelos open-weight chinos consolidan su posición: Kimi K2.6 (1T params MoE, 300 sub-agentes), Qwen3.6-27B (supera modelos 10x más grandes en coding agentico) y GLM-5.1 (754B params MoE) refuerzan a los laboratorios chinos como rivales creíbles de los modelos propietarios occidentales en la carrera SWE-bench.
Plugin URL loading + package manager auto-update
v2.1.129 adds --plugin-url <url> to fetch a plugin .zip archive from a URL for the current session. When CLAUDE_CODE_PACKAGE_MANAGER_AUTO_UPDATE is set on Homebrew or WinGet installs, Claude Code runs the upgrade command in the background and prompts to restart.
MCP auto-retry on startup + skill folder write protection
MCP servers that hit a transient error during startup now auto-retry up to 3 times instead of staying disconnected. Also, --dangerously-skip-permissions no longer prompts for writes to .claude/skills/, .claude/agents/, and .claude/commands/.
Plugin .zip archive support + enhanced /mcp command
v2.1.128 expands plugin support with .zip archive handling and enhances the /mcp command to show tool counts for each connected server. Subprocesses no longer inherit OTEL_* environment variables.
claude project purge command + global Ctrl+R history restored
v2.1.126 introduces the claude project purge command for clearing project state. The Ctrl+R history picker was restored to search all prompts across all projects by default. OAuth login is also improved for environments where the browser callback cannot reach localhost.
Fix: VS Code extension activation on Windows + Mantle auth header
v2.1.131 fixes the VS Code extension failing to activate on Windows due to a hardcoded build path, and resolves the missing x-api-key header for Mantle endpoint authentication.
Multiagent Sessions and Outcomes now in public beta
The Claude developer platform launched Multiagent Sessions and Outcomes in public beta. Webhook support was added for Claude Managed Agents alongside background credential refresh for MCP OAuth. Filtering and sorting options for sessions and events were also expanded.
Dreaming feature: agent self-improving memory in research preview
Claude introduced the dreaming feature in research preview, enabling agents to autonomously improve their own memory across sessions. Webhook notifications for agent task completion were also released.
Usage limits doubled + SpaceX compute deal (220K+ NVIDIA GPUs)
Anthropic doubled Claude Code rate limits for Pro, Max, Team, and Enterprise plans, removed peak-hour rate reductions for Pro and Max, and substantially raised Claude Opus API rate limits. The SpaceX compute deal adds 300+ megawatts of capacity and 220,000+ NVIDIA GPUs.
10 pre-built finance agents + Microsoft 365 add-ins GA
Anthropic released 10 ready-to-run finance agent templates (credit memos, KYC, pitchbooks, earnings analysis, underwriting, month-end close, statement audits, insurance claims) and made Claude add-ins for Excel, PowerPoint, and Word generally available. Claude for Outlook is coming soon. Eight new data connectors were added, including Dun & Bradstreet and Moody's MCP.
Claude Security moves to public beta for Enterprise customers
Claude Security, Anthropic's vulnerability scanning system, transitioned to public beta for Enterprise customers with scheduled and targeted scanning capabilities and webhook integration with Slack and Jira.
Codex 0.128: persisted /goal workflows, MultiAgentV2 config, marketplace plugins
Version 0.128.0 adds persisted /goal workflows with TUI controls (create, pause, resume, clear) and app-server APIs. Permission profiles were expanded with built-in defaults and sandbox CLI profile selection. Plugin management now supports remote marketplace installation and bundle caching. MultiAgentV2 configuration with thread caps and wait-time controls, plus stability fixes for Windows and Bedrock support.
VS Code v1.116–v1.119: semantic search across repos + experimental Chronicle
April-May releases add semantic indexing to search by meaning in any workspace and run grep-style queries across GitHub repos and orgs. Chronicle (experimental) tracks chat interactions in a local database for searching past sessions. Agents can now read/write to open terminals and access browser tabs in real time. System notifications surface long-running terminal commands in chat.
Bring-your-own-key extended to Business and Enterprise + faster CLI 1.0.41
Copilot Business and Enterprise users can now link their own API keys to use models directly in VS Code chat. CLI 1.0.41 (May 5) starts faster by rendering the UI immediately while authentication resolves in the background; shell completions are automatically installed on first run.
Enterprise-managed plugins in Copilot CLI now in public preview
Organizations can now manage custom plugins for their Copilot CLI deployments in public preview, giving IT teams control over which extensions are available to their developers.
Deprecation notice: GPT-5.2 and GPT-5.2-Codex retiring from Copilot
GitHub announced that GPT-5.2 and GPT-5.2-Codex will no longer be available in Copilot. Any configuration explicitly specifying these models should be updated to migrate to newer alternatives.
Model Launches Timeline
| Date | Model | Provider | Tier | Type | Notes |
|---|---|---|---|---|---|
| 2026-04-23 | GPT-5.5 Instant | OpenAI | S+ | Proprietary | New default ChatGPT model, replacing GPT-5.3 Instant. 82.7% on Terminal-Bench 2.0. Stronger on complex terminal workflows, real-world GitHub issue resolution, and long-horizon coding tasks. |
| 2026-04-22 | Qwen3.6-27B | Alibaba / Qwen | A+ | Open | 27B params, Apache 2.0. Outperforms the Qwen3.5-397B-A17B MoE on agentic coding benchmarks. SWE-bench Verified: 77.2%. Hybrid architecture with Gated DeltaNet linear attention and Thinking Preservation mechanism. |
| 2026-04-20 | Kimi K2.6 | Moonshot AI | A+ | Open | 1T param MoE (32B active), Modified MIT. Agent Swarm: up to 300 specialized sub-agents and 4,000 coordinated steps (3x vs K2.5). Natively multimodal. Available via API, Kimi.com, and Kimi Code CLI. |
| 2026-04-16 | Claude Opus 4.7 | Anthropic | S+ | Proprietary | 64.3% SWE-bench Pro (#1 global). 87.6% SWE-bench Verified. 3x image resolution improvement. New xhigh effort level (between high and max). $5/$25 per MTok input/output. |
| 2026-04-16 | Qwen3.6-35B-A3B | Alibaba / Qwen | A | Open | 35B param MoE (3B active), Apache 2.0. First Qwen3.6 series model. Efficient inference with minimal parameter activation. |
| 2026-04-08 | GLM-5.1 | Z.ai (Zhipu) | A | Open | 754B param MoE, open-source (Apache 2.0). Targeted at agentic engineering and long-horizon coding. Subscription preview since late March; open-source released April 8. |
| 2026-04 | DeepSeek V4 | DeepSeek | S | Open | Architectural leap for ultra-long context in production. Trained on 32T+ tokens. Native 1M-token context window. $0.14/MTok — most cost-efficient S-tier option. |
| 2026-04 | Gemini 2.5 Pro | S | Proprietary | GA. Powers Gemini Code Assist Standard and Enterprise. 2M-token context window available on Vertex AI. Gemini 2.0 retiring June 1, 2026. | |
| 2026-03 | Claude Sonnet 4.6 | Anthropic | S | Proprietary | Anthropic's current production model (ID: claude-sonnet-4-6). 1M-token context window generally available since March 13 at no long-context surcharge. |
| 2026-05 | Claude Mythos | Anthropic | S+ | Upcoming | Cybersecurity-focused model in internal testing with limited rollout underway. Revealed via data leak March 2026. Described as a capability step-change by Fortune. |
| 2026-05 | Jupiter-v1-p | Anthropic | S | Upcoming | In internal testing ahead of a potential May 2026 launch. Capability details not yet disclosed. |
| 2026-05 | Gemini 3.1 Ultra | S+ | Upcoming | Expected at Google I/O 2026 (May 19-20). 2M-token context. 94.3% GPQA Diamond. Google retiring Gemini 2.0 (EOL: June 1, 2026) to push the Gemini 3.x family as the new baseline. |
Notable Trends
Agentic computing dominates the week: Claude launched Multiagent Sessions into public beta alongside an agent self-improving memory feature, Codex 0.128 persisted /goal workflows with full TUI, and Copilot extended agents' access to live terminals and browser tabs. Every platform is racing to deliver the most autonomous agent orchestration.
Compute infrastructure is scaling aggressively: Anthropic signed a SpaceX deal adding 300+ megawatts and 220,000+ NVIDIA GPUs, while simultaneously doubling rate limits across all paid plans. Compute is ceasing to be the bottleneck for production AI workloads.
Chinese open-weight models are consolidating their position: Kimi K2.6 (1T param MoE, 300-sub-agent swarm), Qwen3.6-27B (outperforms models 10x its size on agentic coding), and GLM-5.1 (754B param MoE) establish Chinese labs as credible rivals to Western proprietary models in the SWE-bench race.
Chargement de plugins par URL + mise à jour auto du gestionnaire
v2.1.129 ajoute le flag --plugin-url <url> pour charger une archive .zip de plugin depuis une URL pour la session courante. Avec CLAUDE_CODE_PACKAGE_MANAGER_AUTO_UPDATE sur Homebrew ou WinGet, Claude Code exécute la mise à jour en arrière-plan et propose un redémarrage.
Auto-retry MCP au démarrage + protection des dossiers de skills
Les serveurs MCP qui échouent au démarrage réessaient automatiquement jusqu'à 3 fois au lieu de rester déconnectés. De plus, --dangerously-skip-permissions ne demande plus confirmation pour les écritures dans .claude/skills/, .claude/agents/ et .claude/commands/.
Support archives .zip pour plugins + commande /mcp améliorée
v2.1.128 étend le support des plugins avec la gestion des archives .zip et améliore la commande /mcp pour afficher le nombre d'outils par serveur connecté. Les sous-processus n'héritent plus des variables OTEL_*.
Commande claude project purge + historique Ctrl+R global restauré
v2.1.126 introduit la commande claude project purge pour vider l'état du projet. Le sélecteur d'historique Ctrl+R recherche à nouveau dans tous les projets par défaut. La connexion OAuth est améliorée pour les environnements où le callback navigateur ne peut pas atteindre localhost.
Fix : activation extension VS Code sur Windows + header auth Mantle
v2.1.131 corrige l'échec d'activation de l'extension VS Code sur Windows causé par un chemin de build hardcodé, et résout l'absence du header x-api-key pour l'authentification de l'endpoint Mantle.
Multiagent Sessions et Outcomes en bêta publique
La plateforme développeur Claude lance Multiagent Sessions et Outcomes en bêta publique, avec support webhooks pour Claude Managed Agents, rafraîchissement d'identifiants MCP OAuth en arrière-plan, et options de filtrage et tri des sessions étendues.
Feature 'dreaming' : mémoire auto-améliorable des agents en preview
Claude a introduit la fonctionnalité dreaming en preview de recherche, permettant aux agents d'améliorer leur mémoire de façon autonome entre sessions. Des notifications webhook pour la complétion de tâches d'agents ont également été publiées.
Limites d'utilisation doublées + accord calcul SpaceX (220K+ GPUs NVIDIA)
Anthropic a doublé les limites de débit de Claude Code pour les plans Pro, Max, Team et Enterprise, supprimé les réductions aux heures de pointe pour Pro et Max, et considérablement augmenté les limites API Claude Opus. L'accord SpaceX ajoute 300+ MW de capacité et 220 000+ GPUs NVIDIA.
10 agents financiers préconstruits + add-ins Microsoft 365 GA
Anthropic a publié 10 modèles d'agents financiers prêts à l'emploi (mémos de crédit, KYC, pitchbooks, analyse des résultats, souscription, clôture mensuelle, audits d'états financiers, sinistres) et rendu généralement disponibles les add-ins Claude pour Excel, PowerPoint et Word. Claude pour Outlook arrive bientôt. 8 nouveaux connecteurs de données ajoutés, dont Dun & Bradstreet et Moody's MCP.
Claude Security passe en bêta publique pour Enterprise
Claude Security, le système d'analyse de vulnérabilités d'Anthropic, est passé en bêta publique pour les clients Enterprise, avec scan programmé et ciblé et intégration webhook avec Slack et Jira.
Codex 0.128 : workflows /goal persistants, MultiAgentV2, plugins marketplace
La version 0.128.0 ajoute des workflows /goal persistants avec contrôles TUI et APIs app-server. Les profils de permissions ont été étendus avec des défauts intégrés et sélection de profil sandbox via CLI. La gestion des plugins supporte désormais l'installation depuis un marketplace distant. Configuration MultiAgentV2 avec limites de threads et temps d'attente, plus corrections de stabilité Windows et support Bedrock.
VS Code v1.116–v1.119 : recherche sémantique dans les repos + Chronicle expérimental
Les versions avril-mai ajoutent l'indexation sémantique pour rechercher par sens dans tout workspace et des requêtes grep sur les repos GitHub. Chronicle (expérimental) enregistre les interactions chat dans une base locale. Les agents peuvent lire/écrire dans les terminaux ouverts et accéder aux onglets du navigateur. Des notifications système signalent les commandes terminal longues dans le chat.
BYOK étendu à Business et Enterprise + CLI 1.0.41 plus rapide
Les plans Business et Enterprise peuvent désormais lier leurs propres clés API pour utiliser des modèles dans VS Code chat. La CLI 1.0.41 (5 mai) démarre plus vite en rendant l'UI immédiatement ; les complétions shell sont installées automatiquement au premier lancement.
Plugins gérés par l'entreprise dans Copilot CLI en aperçu public
Les organisations peuvent désormais gérer des plugins personnalisés pour leurs déploiements Copilot CLI en aperçu public, donnant aux équipes IT le contrôle sur les extensions disponibles pour leurs développeurs.
Avis de dépréciation : GPT-5.2 et GPT-5.2-Codex retirés de Copilot
GitHub annonce que GPT-5.2 et GPT-5.2-Codex ne seront plus disponibles dans Copilot. Toute configuration spécifiant explicitement ces modèles doit être mise à jour pour migrer vers des alternatives récentes.
Chronologie des Lancements de Modèles
| Date | Modèle | Fournisseur | Tier | Type | Notes |
|---|---|---|---|---|---|
| 2026-04-23 | GPT-5.5 Instant | OpenAI | S+ | Propriétaire | Nouveau modèle par défaut de ChatGPT (remplace GPT-5.3 Instant). 82,7% sur Terminal-Bench 2.0. Meilleur sur les workflows terminal complexes, résolution d'issues GitHub réelles et codage longue durée. |
| 2026-04-22 | Qwen3.6-27B | Alibaba / Qwen | A+ | Ouvert | 27B params, Apache 2.0. Surpasse le MoE Qwen3.5-397B-A17B sur les benchmarks de codage agentique. SWE-bench Verified : 77,2%. Architecture hybride avec attention linéaire Gated DeltaNet et mécanisme Thinking Preservation. |
| 2026-04-20 | Kimi K2.6 | Moonshot AI | A+ | Ouvert | MoE 1T params (32B actifs), Modified MIT. Essaim d'agents : jusqu'à 300 sous-agents spécialisés et 4 000 étapes coordonnées (3x vs K2.5). Multimodal natif. Disponible via API, Kimi.com et Kimi Code CLI. |
| 2026-04-16 | Claude Opus 4.7 | Anthropic | S+ | Propriétaire | 64,3% SWE-bench Pro (n°1 mondial). 87,6% SWE-bench Verified. Résolution d'image 3x améliorée. Nouveau niveau d'effort xhigh (entre high et max). 5$/25$ par MTok entrée/sortie. |
| 2026-04-16 | Qwen3.6-35B-A3B | Alibaba / Qwen | A | Ouvert | MoE 35B params (3B actifs), Apache 2.0. Premier modèle de la série Qwen3.6. Inférence efficace avec activation minimale des paramètres. |
| 2026-04-08 | GLM-5.1 | Z.ai (Zhipu) | A | Ouvert | MoE 754B params, open-source (Apache 2.0). Orienté ingénierie agentique et codage longue durée. Preview abonnés depuis fin mars ; open-source le 8 avril. |
| 2026-04 | DeepSeek V4 | DeepSeek | S | Ouvert | Bond architectural pour le contexte ultra-long en production. 32T+ tokens d'entraînement. Fenêtre contextuelle native 1M tokens. 0,14$/MTok — l'option S-tier la plus économique. |
| 2026-04 | Gemini 2.5 Pro | S | Propriétaire | GA. Propulse Gemini Code Assist Standard et Enterprise. Fenêtre contextuelle 2M tokens disponible sur Vertex AI. Gemini 2.0 retiré le 1er juin 2026. | |
| 2026-03 | Claude Sonnet 4.6 | Anthropic | S | Propriétaire | Modèle de production actuel d'Anthropic (ID : claude-sonnet-4-6). Fenêtre contextuelle 1M tokens généralement disponible depuis le 13 mars sans surcharge. |
| 2026-05 | Claude Mythos | Anthropic | S+ | À venir | Modèle orienté cybersécurité en test interne avec déploiement limité. Révélé par une fuite de données en mars 2026. Décrit comme un changement de niveau par Fortune. |
| 2026-05 | Jupiter-v1-p | Anthropic | S | À venir | En test interne avant un lancement potentiel en mai 2026. Détails des capacités non encore divulgués. |
| 2026-05 | Gemini 3.1 Ultra | S+ | À venir | Attendu pour Google I/O 2026 (19-20 mai). Contexte 2M tokens. 94,3% GPQA Diamond. Google retire Gemini 2.0 (fin de vie : 1er juin 2026) pour imposer la famille Gemini 3.x comme nouvelle base. |
Tendances Notables
Le computing agentique domine la semaine : Claude a lancé Multiagent Sessions en bêta publique avec une fonctionnalité de mémoire auto-améliorable pour les agents, Codex 0.128 a persisté les workflows /goal avec TUI complet, et Copilot a étendu l'accès des agents aux terminaux actifs et onglets de navigateur.
L'infrastructure de calcul monte en puissance : Anthropic a signé un accord SpaceX ajoutant 300+ MW et 220 000+ GPUs NVIDIA, tout en doublant les limites de débit pour tous les plans payants. Le calcul cesse d'être le goulot d'étranglement pour les charges de production.
Les modèles open-weight chinois consolident leur position : Kimi K2.6 (MoE 1T params, 300 sous-agents), Qwen3.6-27B (surpasse des modèles 10x plus grands sur le codage agentique) et GLM-5.1 (MoE 754B params) établissent les labs chinois comme rivaux crédibles des modèles propriétaires occidentaux dans la course SWE-bench.