Bilan Quotidien IA Coding — 20 avril 2026
Claude Opus 4.7 ahora disponible en Claude Code
El nuevo flagship de Anthropic llega a Claude Code. 64.3% en SWE-bench Pro (nuevo #1 global), 87.6% en SWE-bench Verified, 3× mayor resolución de imágenes, nuevo nivel de esfuerzo xhigh y nuevo comando /ultrareview. Task budgets en beta. Precios sin cambio: $5/$25 por MTok.
Computer Use para usuarios Pro y Max: sin configuración
Claude Code puede abrir archivos, ejecutar herramientas de desarrollo, hacer clic y navegar por la pantalla sin configuración adicional, disponible en planes Pro y Max.
Auto Mode: acciones seguras sin aprobación manual
Nuevo modo intermedio entre el flujo de aprobación estándar y dangerously-skip-permissions. Las acciones seguras se ejecutan solas; las riesgosas se bloquean y Claude propone alternativas más seguras.
Voice STT en 20 idiomas, /recap y motor de render sin parpadeo
10 nuevos idiomas para STT (ruso, polaco, turco, holandés, ucraniano, griego, checo, danés, sueco, noruego), total 20. El comando /recap permite retomar una sesión anterior. Nuevo motor de render sin parpadeo.
Claude Design: de idea a visual sin herramienta de diseño
Anthropic lanzó Claude Design (research preview) para usuarios Pro, Max, Team y Enterprise. Crea prototipos, slides, one-pagers y sistemas de diseño completos vía conversación. Lee el codebase y design files de tu empresa para mantener consistencia de marca. Exporta a PDF, URL, PPTX o Canva. Propulsado por Claude Opus 4.7. Las acciones de Figma cayeron ~7% con el anuncio.
Codex 0.121.0: marketplace de plugins, MCP namespaceado y sandbox seguro
Instala plugins desde GitHub, URLs git, directorios locales y marketplace.json. Soporte MCP con registro namespaceado, llamadas paralelas y metadatos de sandbox. Búsqueda inversa de historial (Ctrl+R), perfiles devcontainer seguros con bubblewrap, y correcciones en Windows path handling.
Codex Super App: navegador Atlas integrado, computer use en macOS y chats con hilos
La app escritorio de Codex se convierte en un workspace AI completo con el navegador Atlas integrado, computer use en macOS, chats con hilos, seguimientos programados y revisión enriquecida de pull requests. Lanzada el mismo día que Claude Opus 4.7.
GPT-5.3-Codex-Spark: >1000 tok/s para coding en tiempo real
Preview de investigación de un modelo compacto de la familia GPT-5.3-Codex optimizado para velocidad extrema. Supera los 1000 tokens por segundo. Disponible para usuarios ChatGPT Pro en la app Codex, CLI y extensión IDE.
GPT-5.4 en producción: 57.7% SWE-bench Pro, ~76 tok/s
GPT-5.4 es el modelo de producción actual de OpenAI para coding, con 57.7% en SWE-bench Pro y ~76 tok/s. Superado esta semana por Claude Opus 4.7 (64.3%) y GLM-5.1 (58.4%), pero mantiene fuerte posición en razonamiento visual. GPT-5.5 (nombre interno: Spud) completó pretraining; lanzamiento Q2 2026 esperado.
Gemini 3.1 Pro y 3.0 Flash disponibles en VS Code e IntelliJ (preview)
Gemini 3.1 Pro y Gemini 3.0 Flash están disponibles en las extensiones de Code Assist para VS Code e IntelliJ, en preview. Soportan agent mode, chat y generación de código. El modelo flagship Gemini 3.1 Ultra alcanza 94.3% en GPQA Diamond y 77.1% en ARC-AGI-2.
API Gemini Cloud Assist migrada a geminicloudassist.googleapis.com
A partir del 16 de abril, la API geminicloudassist.googleapis.com se habilitó automáticamente en proyectos elegibles. El chat de Cloud Assist migra desde cloudaicompanion.googleapis.com. Ambas son dependencias requeridas.
Historial de chat, reglas por proyecto y comandos personalizados
Historial de chat y threads para retomar trabajo exactamente donde lo dejaste. Reglas aplicadas a todas las generaciones de IA (ej. «siempre agregar unit tests»). Comandos personalizados (ej. «generar manejo de excepciones»). Cumplimiento FedRAMP disponible para el gobierno de EE.UU.
Autopilot: sesiones de agente completamente autónomas (preview público)
Autopilot permite a Copilot ejecutar sesiones de agente sin intervención manual, con debugging de navegador integrado, soporte de imágenes y videos en chat, y editor unificado para gestionar personalizaciones. El agente puede devolver capturas de pantalla y grabaciones revisables en un carrusel con zoom y navegación por miniaturas.
Claude Opus 4.7 en Copilot: multiplicador premium 7.5× (hasta el 30 de abril)
Claude Opus 4.7 llega a GitHub Copilot con mejor desempeño en tareas multi-step y ejecución agéntica más confiable. Lanzado con multiplicador de solicitudes premium de 7.5× como precio promocional hasta el 30 de abril. La selección automática de modelos también queda GA para todos los planes.
gh skill: gestión de skills de agente desde el CLI de GitHub
Nuevo comando gh skill en GitHub CLI para descubrir, instalar, gestionar, actualizar y publicar skills de agente con version pinning, provenance tracking y salvaguardas de supply chain. Public preview.
Residencia de datos en EE.UU. y UE, más cumplimiento FedRAMP
Todo el procesamiento de inferencia y los datos asociados permanecen dentro de la geografía designada (US o EU). Cumplimiento FedRAMP para clientes del gobierno de EE.UU.
Línea de Tiempo — Lanzamientos de Modelos
| Fecha | Modelo | Proveedor | Tier | Tipo | Notas |
|---|---|---|---|---|---|
| 2026-04-16 | Claude Opus 4.7 | Anthropic | S+ | Propietario | 64.3% SWE-bench Pro (nuevo #1 global), 87.6% SWE-bench Verified, 3× resolución de imagen, nivel de esfuerzo xhigh, $5/$25 por MTok |
| 2026-04-07 | GLM-5.1 | Z.ai / Zhipu | S | Abierto | 754B MoE, 58.4% SWE-bench Pro (#1 mundial al lanzar, luego #2 tras Opus 4.7), licencia MIT, bucle de ejecución autónoma hasta 8h |
| 2026-04-02 | Qwen 3.6-Plus | Alibaba / Qwen | A+ | Abierto | Equivale a Claude Opus 4.5 en SWE-bench y Terminal-Bench 2.0. ~158 tok/s, 1.7× más rápido que Claude Opus 4.6. Foco en coding agéntico y multimodal. |
| 2026-04-13 | Kimi K2.6 Code (beta) | Moonshot AI / Kimi | A+ | Próximo | Beta de K2.6 Code Preview: MoE de un trillón de parámetros, mejoras significativas en code gen y capacidades agénticas. Lanzamiento formal esperado ~mayo 2026. |
| 2026-03-01 | Gemini 3.1 Ultra / Flash / Flash Live | S+ | Propietario | Ultra: 94.3% GPQA Diamond, 77.1% ARC-AGI-2. Flash-Lite optimizado para velocidad. Flash Live: audio en tiempo real. Disponibles en Code Assist (preview). | |
| 2026-04-16 | GPT-5.3-Codex-Spark | OpenAI | A | Propietario | Modelo compacto de la familia GPT-5.3-Codex optimizado para velocidad: >1000 tok/s. Research preview, disponible para ChatGPT Pro en app Codex, CLI e IDE. |
| 2026-02-15 | Doubao 2.0 | ByteDance | A | Propietario | Para la 'era de agentes'. Versión pro equipara a GPT-5.2 en razonamiento complejo y multi-step. ~10× más barato que la competencia. |
| 2026-02-01 | MiniMax M2.2 | MiniMax | A+ | Abierto | Optimizado para programadores con capacidades para tareas complejas. Lanzado antes del Spring Festival 2026. |
| 2026-04-28 | DeepSeek V4 (expected) | DeepSeek | S+ | Próximo | ~1T parámetros totales, ~37B activos/token. Arquitectura de memoria condicional, 97% Needle-in-Haystack a 1M tokens. Chips Huawei Ascend. Apache 2.0. Lanzamiento esperado 2a quincena de abril. |
Tendencias Destacadas
La semana estuvo dominada por Anthropic, que lanzó Claude Opus 4.7 (nuevo líder absoluto en SWE-bench Pro con 64.3%) y Claude Design el mismo día — una señal clara de que la compañía se mueve de proveedor de modelos a empresa de productos full-stack. El impacto fue inmediato: las acciones de Figma cayeron ~7% en pocas horas.
Los benchmarks de coding se están comprimiendo rápidamente: cinco modelos de clase frontier ahora compiten dentro de pocos puntos porcentuales en SWE-bench Pro. GLM-5.1 de Z.ai brevemente lideró el ranking global antes de ser superado por Opus 4.7 — primera vez que un modelo open-source chino alcanza el puesto #1 mundial en coding.
El modo autónomo se convierte en el eje central de todos los asistentes: Copilot estrena Autopilot (sesiones de agente sin supervisión), OpenAI transforma Codex en una super app con computer use, y Claude Code consolida Auto Mode. La pregunta ya no es 'qué puede hacer la IA sola' sino 'cuánto tiempo puede operar sin intervención humana'.
Claude Opus 4.7 now available in Claude Code
Anthropic's new flagship model lands in Claude Code. 64.3% on SWE-bench Pro (new global #1), 87.6% on SWE-bench Verified, 3× image resolution, new xhigh effort level, and new /ultrareview command. Task budgets in beta. Pricing unchanged: $5/$25 per MTok.
Computer Use for Pro and Max users: zero setup required
Claude Code can now open files, run dev tools, point, click, and navigate the screen with no extra setup. Available out of the box for Pro and Max subscribers.
Auto Mode: safe actions run without manual approval
A new middle ground between the standard approval flow and dangerously-skip-permissions. Safe actions run automatically; risky ones are blocked and Claude is steered toward safer alternatives.
Voice STT in 20 languages, /recap command, flicker-free render engine
10 new STT languages added (Russian, Polish, Turkish, Dutch, Ukrainian, Greek, Czech, Danish, Swedish, Norwegian), bringing the total to 20. The /recap command lets you resume a prior session. New flicker-free rendering engine.
Claude Design: from idea to visual without a design tool
Anthropic launched Claude Design (research preview) for Pro, Max, Team, and Enterprise subscribers. Create prototypes, slides, one-pagers, and complete design systems via conversation. Claude reads your codebase and design files to maintain brand consistency. Exports to PDF, URL, PPTX, or Canva. Powered by Claude Opus 4.7. Figma stock fell ~7% on the news.
Codex 0.121.0: plugin marketplace, namespaced MCP, and secure sandbox
Install plugins from GitHub, git URLs, local dirs, and marketplace.json. Namespaced MCP registration, parallel calls, and sandbox metadata for servers. Reverse history search (Ctrl+R), secure devcontainer profiles with bubblewrap, and Windows path handling fixes.
Codex Super App: Atlas in-app browser, macOS computer use, threaded chats
The Codex desktop app becomes a full AI workspace with the integrated Atlas browser, macOS computer use, threaded chats, scheduled follow-ups, and richer PR review. Launched the same day as Claude Opus 4.7.
GPT-5.3-Codex-Spark: >1,000 tok/s for real-time coding
Research preview of a compact GPT-5.3-Codex model optimized for extreme speed. Exceeds 1,000 tokens per second. Available for ChatGPT Pro users in the latest Codex app, CLI, and IDE extension.
GPT-5.4 in production: 57.7% SWE-bench Pro, ~76 tok/s
GPT-5.4 is OpenAI's current production model for coding, with 57.7% on SWE-bench Pro and ~76 tok/s. Surpassed this week by Claude Opus 4.7 (64.3%) and GLM-5.1 (58.4%), but maintains strong visual reasoning. GPT-5.5 (codename: Spud) has completed pretraining; Q2 2026 launch expected.
Gemini 3.1 Pro and 3.0 Flash available in VS Code and IntelliJ (preview)
Gemini 3.1 Pro and Gemini 3.0 Flash are now available in Code Assist extensions for VS Code and IntelliJ, in preview. Supports agent mode, chat, and code generation. The flagship Gemini 3.1 Ultra scores 94.3% on GPQA Diamond and 77.1% on ARC-AGI-2.
Gemini Cloud Assist API migrated to geminicloudassist.googleapis.com
As of April 16, the geminicloudassist.googleapis.com API was auto-enabled on eligible projects. Cloud Assist chat migrates from cloudaicompanion.googleapis.com. Both are required dependencies going forward.
Chat history, per-project rules, and custom commands
Chat history and threads to pick up exactly where you left off. Rules applied to every AI generation (e.g., "always add unit tests"). Custom commands (e.g., "generate exception handling logic"). FedRAMP compliance for US government customers.
Autopilot: fully autonomous agent sessions (public preview)
Autopilot lets Copilot run fully autonomous agent sessions, with integrated browser debugging, image and video support in chat, and a unified editor for managing chat customizations. The agent can return screenshots and recordings reviewable in a carousel with zoom and thumbnail navigation.
Claude Opus 4.7 on Copilot: 7.5× premium multiplier (until April 30)
Claude Opus 4.7 arrives on GitHub Copilot with stronger multi-step task performance and more reliable agentic execution. Launching with a 7.5× premium request multiplier as promotional pricing until April 30. Auto model selection is also now GA for all plans.
gh skill: manage agent skills from the GitHub CLI
New gh skill command in GitHub CLI for discovering, installing, managing, updating, and publishing agent skills with version pinning, provenance tracking, and supply chain safeguards. Public preview.
Data residency in US and EU regions, plus FedRAMP compliance
All inference processing and associated data stays within the designated geography (US or EU). FedRAMP compliance available for US government customers.
Model Launches Timeline
| Date | Model | Provider | Tier | Type | Notes |
|---|---|---|---|---|---|
| 2026-04-16 | Claude Opus 4.7 | Anthropic | S+ | Proprietary | 64.3% SWE-bench Pro (new global #1), 87.6% SWE-bench Verified, 3× image resolution, xhigh effort level, $5/$25 per MTok |
| 2026-04-07 | GLM-5.1 | Z.ai / Zhipu | S | Open | 754B MoE, 58.4% SWE-bench Pro (#1 at launch, then #2 after Opus 4.7), MIT license, up to 8h autonomous execution loop |
| 2026-04-02 | Qwen 3.6-Plus | Alibaba / Qwen | A+ | Open | Matches Claude Opus 4.5 on SWE-bench and Terminal-Bench 2.0. ~158 tok/s, 1.7× faster than Claude Opus 4.6. Focus on agentic coding and multimodal perception. |
| 2026-04-13 | Kimi K2.6 Code (beta) | Moonshot AI / Kimi | A+ | Upcoming | K2.6 Code Preview beta: trillion-parameter MoE, major improvements in code generation and agent capabilities. Formal release expected ~May 2026. |
| 2026-03-01 | Gemini 3.1 Ultra / Flash / Flash Live | S+ | Proprietary | Ultra: 94.3% GPQA Diamond, 77.1% ARC-AGI-2. Flash-Lite speed-optimized. Flash Live: real-time audio. Available in Code Assist (preview). | |
| 2026-04-16 | GPT-5.3-Codex-Spark | OpenAI | A | Proprietary | Compact GPT-5.3-Codex model optimized for speed: >1,000 tok/s. Research preview, available for ChatGPT Pro in Codex app, CLI, and IDE extension. |
| 2026-02-15 | Doubao 2.0 | ByteDance | A | Proprietary | For the 'agent era'. Pro version matches GPT-5.2 on complex reasoning and multi-step tasks. ~10× cheaper than competition. |
| 2026-02-01 | MiniMax M2.2 | MiniMax | A+ | Open | Optimized for developers with strong complex-task capabilities. Released before Spring Festival 2026. |
| 2026-04-28 | DeepSeek V4 (expected) | DeepSeek | S+ | Upcoming | ~1T total parameters, ~37B active per token. Conditional memory architecture, 97% Needle-in-Haystack at 1M-token scale. Huawei Ascend chips. Apache 2.0. Expected late April. |
Notable Trends
The week was dominated by Anthropic, which launched Claude Opus 4.7 (new SWE-bench Pro leader at 64.3%) and Claude Design on the same day — a clear signal the company is moving from model provider to full-stack product company. The impact was immediate: Figma's stock fell ~7% within hours.
Coding benchmarks are compressing fast: five frontier-class models now compete within a few percentage points on SWE-bench Pro. Z.ai's GLM-5.1 briefly led the global leaderboard before being surpassed by Opus 4.7 — the first time an open-source Chinese model reached the global #1 spot in coding.
Autonomous mode is becoming the central axis of all coding assistants: Copilot debuts Autopilot (unsupervised agent sessions), OpenAI transforms Codex into a super app with computer use, and Claude Code solidifies Auto Mode. The question is no longer 'what can AI do alone' but 'how long can it operate without human intervention'.
Claude Opus 4.7 disponible dans Claude Code
Le nouveau modèle phare d'Anthropic arrive dans Claude Code. 64,3% sur SWE-bench Pro (nouveau #1 mondial), 87,6% sur SWE-bench Verified, résolution d'image 3×, nouveau niveau d'effort xhigh et commande /ultrareview. Task budgets en beta. Prix inchangé : 5$/25$ par MTok.
Computer Use pour les utilisateurs Pro et Max : aucune configuration
Claude Code peut désormais ouvrir des fichiers, exécuter des outils de dev, cliquer et naviguer à l'écran sans configuration supplémentaire. Disponible pour les abonnés Pro et Max.
Auto Mode : les actions sûres s'exécutent sans approbation manuelle
Un nouveau juste milieu entre le flux d'approbation standard et dangerously-skip-permissions. Les actions sûres s'exécutent automatiquement ; les risquées sont bloquées et Claude est orienté vers des alternatives plus sûres.
Voice STT dans 20 langues, commande /recap, moteur de rendu sans scintillement
10 nouvelles langues STT ajoutées (russe, polonais, turc, néerlandais, ukrainien, grec, tchèque, danois, suédois, norvégien), portant le total à 20. La commande /recap permet de reprendre une session précédente. Nouveau moteur de rendu sans scintillement.
Claude Design : de l'idée au visuel sans outil de design
Anthropic a lancé Claude Design (aperçu recherche) pour les abonnés Pro, Max, Team et Enterprise. Créez des prototypes, slides, one-pagers et systèmes de design complets via conversation. Claude lit votre codebase et vos fichiers de design pour maintenir la cohérence de marque. Exports en PDF, URL, PPTX ou Canva. Propulsé par Claude Opus 4.7. L'action Figma a chuté de ~7% à l'annonce.
Codex 0.121.0 : marketplace de plugins, MCP namespaceé et sandbox sécurisé
Installez des plugins depuis GitHub, URLs git, dossiers locaux et marketplace.json. Enregistrement MCP namespaceé, appels parallèles et métadonnées sandbox. Recherche historique inversée (Ctrl+R), profils devcontainer sécurisés avec bubblewrap, et corrections de chemins Windows.
Codex Super App : navigateur Atlas intégré, computer use macOS, chats en fils
L'application bureau Codex devient un espace de travail IA complet avec le navigateur Atlas intégré, computer use sur macOS, chats en fils, suivis programmés et révision enrichie des PRs. Lancée le même jour que Claude Opus 4.7.
GPT-5.3-Codex-Spark : >1 000 tok/s pour le coding en temps réel
Aperçu de recherche d'un modèle compact GPT-5.3-Codex optimisé pour la vitesse extrême. Dépasse 1 000 tokens par seconde. Disponible pour les utilisateurs ChatGPT Pro dans la dernière app Codex, CLI et extension IDE.
GPT-5.4 en production : 57,7% SWE-bench Pro, ~76 tok/s
GPT-5.4 est le modèle de production actuel d'OpenAI pour le coding, avec 57,7% sur SWE-bench Pro et ~76 tok/s. Surpassé cette semaine par Claude Opus 4.7 (64,3%) et GLM-5.1 (58,4%), mais maintient une forte position en raisonnement visuel. GPT-5.5 (nom de code : Spud) a terminé le préentraînement ; lancement Q2 2026 attendu.
Gemini 3.1 Pro et 3.0 Flash disponibles dans VS Code et IntelliJ (aperçu)
Gemini 3.1 Pro et Gemini 3.0 Flash sont désormais disponibles dans les extensions Code Assist pour VS Code et IntelliJ, en aperçu. Supporte le mode agent, le chat et la génération de code. Le modèle phare Gemini 3.1 Ultra atteint 94,3% sur GPQA Diamond et 77,1% sur ARC-AGI-2.
API Gemini Cloud Assist migrée vers geminicloudassist.googleapis.com
À partir du 16 avril, l'API geminicloudassist.googleapis.com a été activée automatiquement sur les projets éligibles. Le chat Cloud Assist migre depuis cloudaicompanion.googleapis.com. Les deux sont des dépendances requises.
Historique de chat, règles par projet et commandes personnalisées
Historique de chat et fils pour reprendre exactement où vous vous étiez arrêté. Règles appliquées à chaque génération IA (ex. : «toujours ajouter des tests unitaires»). Commandes personnalisées (ex. : «générer la gestion des exceptions»). Conformité FedRAMP pour les clients gouvernementaux américains.
Autopilot : sessions d'agent entièrement autonomes (aperçu public)
Autopilot permet à Copilot d'exécuter des sessions d'agent entièrement autonomes, avec débogage navigateur intégré, support d'images et vidéos dans le chat, et éditeur unifié pour gérer les personnalisations. L'agent peut retourner des captures et enregistrements révisables dans un carrousel avec zoom et navigation.
Claude Opus 4.7 sur Copilot : multiplicateur premium 7,5× (jusqu'au 30 avril)
Claude Opus 4.7 arrive sur GitHub Copilot avec de meilleures performances multi-étapes et une exécution agentique plus fiable. Lancé avec un multiplicateur de requêtes premium 7,5× comme prix promotionnel jusqu'au 30 avril. La sélection automatique de modèle est également GA pour tous les plans.
gh skill : gérer les compétences d'agent depuis le GitHub CLI
Nouvelle commande gh skill dans GitHub CLI pour découvrir, installer, gérer, mettre à jour et publier des compétences d'agent avec ancrage de version, suivi de provenance et protections de la chaîne d'approvisionnement. Aperçu public.
Résidence des données en régions US et UE, plus conformité FedRAMP
Tout le traitement d'inférence et les données associées restent dans la géographie désignée (US ou UE). Conformité FedRAMP disponible pour les clients gouvernementaux américains.
Chronologie des Lancements de Modèles
| Date | Modèle | Fournisseur | Tier | Type | Notes |
|---|---|---|---|---|---|
| 2026-04-16 | Claude Opus 4.7 | Anthropic | S+ | Propriétaire | 64,3% SWE-bench Pro (nouveau #1 mondial), 87,6% SWE-bench Verified, résolution image 3×, niveau xhigh, 5$/25$ par MTok |
| 2026-04-07 | GLM-5.1 | Z.ai / Zhipu | S | Ouvert | 754B MoE, 58,4% SWE-bench Pro (#1 au lancement, #2 après Opus 4.7), licence MIT, boucle autonome jusqu'à 8h |
| 2026-04-02 | Qwen 3.6-Plus | Alibaba / Qwen | A+ | Ouvert | Égale Claude Opus 4.5 sur SWE-bench et Terminal-Bench 2.0. ~158 tok/s, 1,7× plus rapide que Claude Opus 4.6. Focus sur le coding agentique et multimodal. |
| 2026-04-13 | Kimi K2.6 Code (beta) | Moonshot AI / Kimi | A+ | À venir | Beta K2.6 Code Preview : MoE à un trillion de paramètres, améliorations majeures en génération de code et capacités agentiques. Lancement officiel attendu ~mai 2026. |
| 2026-03-01 | Gemini 3.1 Ultra / Flash / Flash Live | S+ | Propriétaire | Ultra : 94,3% GPQA Diamond, 77,1% ARC-AGI-2. Flash-Lite optimisé pour la vitesse. Flash Live : audio temps réel. Disponible dans Code Assist (aperçu). | |
| 2026-04-16 | GPT-5.3-Codex-Spark | OpenAI | A | Propriétaire | Modèle compact GPT-5.3-Codex optimisé pour la vitesse : >1 000 tok/s. Aperçu recherche, disponible pour ChatGPT Pro dans l'app Codex, CLI et extension IDE. |
| 2026-02-15 | Doubao 2.0 | ByteDance | A | Propriétaire | Pour l'ère des agents. La version pro égale GPT-5.2 sur le raisonnement complexe. ~10× moins cher que la concurrence. |
| 2026-02-01 | MiniMax M2.2 | MiniMax | A+ | Ouvert | Optimisé pour les développeurs avec de solides capacités sur les tâches complexes. Lancé avant le Spring Festival 2026. |
| 2026-04-28 | DeepSeek V4 (expected) | DeepSeek | S+ | À venir | ~1T paramètres totaux, ~37B actifs/token. Mémoire conditionnelle, 97% Needle-in-Haystack à 1M tokens. Puces Huawei Ascend. Apache 2.0. Attendu fin avril. |
Tendances Notables
La semaine a été dominée par Anthropic, qui a lancé Claude Opus 4.7 (nouveau leader SWE-bench Pro à 64,3%) et Claude Design le même jour — signal clair que la société passe de fournisseur de modèles à entreprise de produits full-stack. L'impact fut immédiat : l'action Figma a chuté de ~7% en quelques heures.
Les benchmarks coding se resserrent rapidement : cinq modèles de classe frontier concourent désormais à quelques points sur SWE-bench Pro. Le GLM-5.1 de Z.ai a brièvement mené le classement mondial avant d'être dépassé par Opus 4.7 — première fois qu'un modèle open-source chinois atteignait le #1 mondial en coding.
Le mode autonome devient l'axe central de tous les assistants coding : Copilot lance Autopilot (sessions sans surveillance), OpenAI transforme Codex en super app avec computer use, et Claude Code consolide Auto Mode. La question n'est plus 'que peut faire l'IA seule' mais 'combien de temps peut-elle opérer sans intervention humaine'.