Informe Diario: Herramientas de IA para Desarrollo — 14 de mayo de 2026
v2.1.141: terminalSequence, agents --cwd y Rewind mejorado (13 may, 23:19)
v2.1.141 añade el campo terminalSequence al JSON de salida de hooks para disparar notificaciones de escritorio, títulos de ventana y campanillas sin controlar el terminal. claude agents --cwd <path> filtra la lista de sesiones a un directorio específico. La opción «Summarize up to here» en el menú Rewind comprime el contexto antiguo directamente desde la UI. También incluye ANTHROPIC_WORKSPACE_ID para workload identity federation, CLAUDE_CODE_PLUGIN_PREFER_HTTPS para clonar plugins por HTTPS en lugar de SSH, mejoras en el spinner de extended thinking (indicador ámbar tras 10 s) y más de 50 correcciones de bugs incluyendo naming de background jobs, regresiones del model picker y renderizado de tablas Markdown.
Codex para Chrome: extensión que lleva el agente al navegador
OpenAI lanzó el 7 may una extensión de Chrome que permite a Codex trabajar en paralelo entre pestañas sin apoderarse del navegador activo. Agrupa su actividad en pestañas Chrome aisladas, puede usar DevTools, probar apps web y acceder a servicios autenticados como Gmail, Salesforce o LinkedIn usando la sesión firmada del usuario. Cada nuevo dominio requiere confirmación explícita del usuario. Codex ya supera los 4 millones de usuarios activos semanales — 8 veces más que a principios de año.
GPT-Realtime-2, Translate y Whisper: tres nuevos modelos de voz en la API
El 7 may, OpenAI lanzó tres modelos de voz en tiempo real para desarrolladores. GPT-Realtime-2 es el primero con razonamiento de clase GPT-5: piensa antes de hablar en solicitudes complejas y tiene ventana de contexto ampliada. GPT-Realtime-Translate traduce voz en directo desde más de 70 idiomas de entrada a 13 idiomas de salida manteniendo el ritmo del hablante. GPT-Realtime-Whisper transcribe voz en streaming conforme el hablante habla. Los tres están disponibles en la API para desarrolladores y habilitan una nueva clase de apps de voz productivas.
Google I/O 2026 en 5 días — Gemini 4, Antigravity IDE y Gemini CLI
Google I/O 2026 arranca el 19-20 de mayo con fuerte énfasis en IA agéntica. Se esperan: Gemini 4 como sucesor de Gemini 3.1 Pro (94.3% GPQA Diamond, 77.1% ARC-AGI-2), la Gemini Enterprise Agent Platform para flujos multi-agente corporativos, Google Antigravity (IDE agéntico en preview), y la Gemini CLI open-source para terminales. Suscriptores de Google AI Pro ya reciben $10/mes en créditos Cloud; Ultra recibe $100/mes.
Iniciar tareas de agente cloud de Copilot vía REST API
El 13 may, GitHub añadió la posibilidad de iniciar tareas de agente cloud de Copilot programáticamente a través de la REST API. Esto desbloquea la orquestación de agentes Copilot desde pipelines CI/CD, scripts de automatización y flujos externos sin necesidad de intervención manual en la interfaz web.
Tipos de comentario de revisión ahora en la API de métricas de uso
El 8 may, la API de métricas de uso de Copilot incorporó desglose por tipo de comentario de revisión de código, con nuevos conteos agregados por categoría de sugerencia y frecuencia de aplicación. Util para auditorías de adopción de Copilot Code Review antes del cambio de billing a AI Credits del 1 de junio.
Línea de Tiempo — Lanzamientos de Modelos
| Fecha | Modelo | Proveedor | Tier | Tipo | Notas |
|---|---|---|---|---|---|
| 2026-05-07 | GPT-Realtime-2 | OpenAI | A+ | Propietario | Primer modelo de voz con razonamiento GPT-5. Piensa antes de responder en audio. API de desarrolladores. |
| 2026-05-07 | GPT-Realtime-Translate | OpenAI | A | Propietario | Traducción de voz en directo: 70+ idiomas de entrada a 13 de salida, al ritmo del hablante. |
| 2026-05-07 | GPT-Realtime-Whisper | OpenAI | A | Propietario | Transcripción de voz en streaming en tiempo real conforme el hablante habla. |
| 2026-05-06 | Grok 4.3 | xAI | A+ | Propietario | Última versión de Grok. Mejoras en razonamiento y codificación. |
| 2026-05-05 | GPT-5.5 Instant | OpenAI | A+ | Propietario | Nuevo modelo por defecto de ChatGPT. 52.5% menos alucinaciones que GPT-5.3 Instant. |
| 2026-04-27 | Qwen3.6-Max-Preview | Alibaba / Qwen | S | Propietario | Modelo propietario de Qwen. Lidera 6 benchmarks de codificación. Disponible via Qwen Studio. |
| 2026-04-24 | DeepSeek-V4-Pro | DeepSeek | S | Abierto | MoE 1.6T parámetros, contexto 1M tokens. $0.145/MTok entrada. Coding y agentes. |
| 2026-04-24 | DeepSeek-V4-Flash | DeepSeek | A+ | Abierto | 284B parámetros MoE, 1M tokens. $0.14/$0.28 por MTok. Variante rápida de V4-Pro. |
| 2026-04-22 | Qwen3.6-27B | Alibaba / Qwen | A+ | Abierto | Dense open-weight, 77.2 SWE-bench Verified. Supera Qwen3.5-397B MoE en coding. Apache 2.0. |
| 2026-04-20 | Kimi K2.6 | Moonshot / Kimi | A+ | Abierto | 1T params (32B activos). Agent Swarm: 300 sub-agentes, 4000 pasos coordinados. Licencia MIT. |
| 2026-04-16 | Claude Opus 4.7 | Anthropic | S+ | Propietario | 64.3% SWE-bench Pro (n.º 1 global). Nivel xhigh. Visión 3x resolución. $5/$25 por MTok. |
Tendencias Destacadas
La semana consolida la expansión de agentes hacia nuevos entornos: Claude Code con Agent View para gestionar sesiones paralelas desde la CLI (v2.1.139), Codex en el navegador Chrome para acceder a servicios web autenticados, y ahora Copilot con agentes cloud orquestables vía REST API. La pregunta que surge es cuándo estos entornos convergerán en un plano de control unificado.
OpenAI dividió la interfaz de voz en tres modelos especializados — razonamiento, traducción y transcripción — en lugar de un único modelo generalista. Es una apuesta por verticales productivas específicas (atención al cliente, conferencias multilingüe, dictado técnico) que necesitan latencia ultra-baja sin sacrificar calidad.
Con Google I/O a cinco días, el ecosistema está en modo anticipación: Gemini 3.1 Pro lidera razonamiento académico (94.3% GPQA Diamond), pero Gemini 4 y el IDE Antigravity podrían redefinir el stack de desarrollo de IA agéntica. La presión competitiva de DeepSeek V4-Pro (1.6T params, 1M tokens, precios agresivos) mantiene a los labs occidentales con el pedal al fondo.
v2.1.141: terminalSequence, agents --cwd, and improved Rewind (May 13, 23:19)
v2.1.141 adds the terminalSequence field to hook JSON output for triggering desktop notifications, window titles, and bells without taking over the terminal. claude agents --cwd <path> scopes the session list to a specific directory. «Summarize up to here» in the Rewind menu compresses earlier context directly from the UI. Also adds ANTHROPIC_WORKSPACE_ID for workload identity federation, CLAUDE_CODE_PLUGIN_PREFER_HTTPS to clone plugins over HTTPS instead of SSH, improved spinner feedback during extended thinking (amber indicator after 10 s), and 50+ bug fixes including background job naming, model picker regressions, and Markdown table rendering.
Codex for Chrome: extension that brings the agent into the browser
OpenAI launched on May 7 a Chrome extension that lets Codex work in parallel across tabs without commandeering the active browser. It groups activity into isolated Chrome tabs, can use DevTools, test web apps, and access authenticated services like Gmail, Salesforce, or LinkedIn via the user's signed-in session. Each new domain requires explicit user confirmation. Codex now surpasses 4 million weekly active users — 8x growth since the start of the year.
GPT-Realtime-2, Translate, and Whisper: three new voice models in the API
On May 7, OpenAI shipped three realtime voice models for developers. GPT-Realtime-2 is the first with GPT-5-class reasoning: it thinks before speaking on complex requests and has an expanded context window. GPT-Realtime-Translate does live speech translation from 70+ input languages to 13 output languages while keeping pace with the speaker. GPT-Realtime-Whisper streams live transcription in real time as the speaker talks. All three are available in the developer API and unlock a new class of productive voice apps.
Google I/O 2026 in 5 days — Gemini 4, Antigravity IDE, and Gemini CLI
Google I/O 2026 kicks off on May 19-20 with heavy emphasis on agentic AI. Expected: Gemini 4 succeeding Gemini 3.1 Pro (94.3% GPQA Diamond, 77.1% ARC-AGI-2), the Gemini Enterprise Agent Platform for corporate multi-agent workflows, Google Antigravity (agentic IDE in preview), and the open-source Gemini CLI for terminals. Google AI Pro subscribers already get $10/month in Cloud credits; Ultra gets $100/month.
Start Copilot cloud agent tasks via REST API
On May 13, GitHub added the ability to programmatically start Copilot cloud agent tasks via the REST API. This unlocks orchestration of Copilot agents from CI/CD pipelines, automation scripts, and external workflows without requiring manual intervention through the web interface.
Code review comment types now in the usage metrics API
On May 8, Copilot's usage metrics API added a breakdown of code review suggestions by comment type, with new aggregated counts per suggestion category and how often each was applied — useful for auditing Copilot Code Review adoption ahead of the June 1 AI Credits billing switch.
Model Launches Timeline
| Date | Model | Provider | Tier | Type | Notes |
|---|---|---|---|---|---|
| 2026-05-07 | GPT-Realtime-2 | OpenAI | A+ | Proprietary | First voice model with GPT-5-class reasoning. Thinks before responding in audio. Developer API. |
| 2026-05-07 | GPT-Realtime-Translate | OpenAI | A | Proprietary | Live speech translation: 70+ input languages to 13 output languages, keeping pace with the speaker. |
| 2026-05-07 | GPT-Realtime-Whisper | OpenAI | A | Proprietary | Streaming real-time speech-to-text transcription as the speaker talks. |
| 2026-05-06 | Grok 4.3 | xAI | A+ | Proprietary | Latest Grok release. Improved reasoning and coding capabilities. |
| 2026-05-05 | GPT-5.5 Instant | OpenAI | A+ | Proprietary | New ChatGPT default model. 52.5% fewer hallucinations than GPT-5.3 Instant. |
| 2026-04-27 | Qwen3.6-Max-Preview | Alibaba / Qwen | S | Proprietary | Qwen's most powerful proprietary model. Tops 6 coding benchmarks. Available via Qwen Studio. |
| 2026-04-24 | DeepSeek-V4-Pro | DeepSeek | S | Open | 1.6T parameter MoE, 1M token context. $0.145/MTok input. Built for coding and agents. |
| 2026-04-24 | DeepSeek-V4-Flash | DeepSeek | A+ | Open | 284B parameter MoE, 1M token context. $0.14/$0.28 per MTok. Faster companion to V4-Pro. |
| 2026-04-22 | Qwen3.6-27B | Alibaba / Qwen | A+ | Open | Dense open-weight, 77.2 SWE-bench Verified. Beats Qwen3.5-397B MoE on coding. Apache 2.0. |
| 2026-04-20 | Kimi K2.6 | Moonshot / Kimi | A+ | Open | 1T params (32B active). Agent Swarm: 300 sub-agents, 4000 coordinated steps. MIT license. |
| 2026-04-16 | Claude Opus 4.7 | Anthropic | S+ | Proprietary | 64.3% SWE-bench Pro (global #1). xhigh effort level. 3x image resolution. $5/$25 per MTok. |
Notable Trends
The week solidifies the expansion of agents into new environments: Claude Code with Agent View for managing parallel sessions from the CLI (v2.1.139), Codex in the Chrome browser for accessing authenticated web services, and now Copilot with cloud agents orchestrable via REST API. The emerging question is when these environments will converge into a unified control plane.
OpenAI split the voice interface into three specialized models — reasoning, translation, and transcription — instead of a single generalist model. It is a bet on specific productive verticals (customer support, multilingual conferencing, technical dictation) that need ultra-low latency without sacrificing quality.
With Google I/O five days out, the ecosystem is in anticipation mode: Gemini 3.1 Pro leads academic reasoning (94.3% GPQA Diamond), but Gemini 4 and the Antigravity IDE could redefine the agentic AI development stack. Competitive pressure from DeepSeek V4-Pro (1.6T params, 1M token context, aggressive pricing) keeps Western labs pushing hard.
v2.1.141: terminalSequence, agents --cwd et Rewind amélioré (13 mai, 23:19)
v2.1.141 ajoute le champ terminalSequence au JSON de sortie des hooks pour déclencher des notifications bureau, titres de fenêtre et sonneries sans monopoliser le terminal. claude agents --cwd <path> filtre la liste de sessions à un répertoire précis. «Summarize up to here» dans le menu Rewind compresse le contexte antérieur depuis l'interface. Aussi: ANTHROPIC_WORKSPACE_ID pour workload identity federation, CLAUDE_CODE_PLUGIN_PREFER_HTTPS, spinner amélioré pour le extended thinking, et plus de 50 correctifs.
Codex pour Chrome: extension qui amène l'agent dans le navigateur
OpenAI a lancé le 7 mai une extension Chrome qui permet à Codex de travailler en parallèle entre onglets sans monopoliser le navigateur actif. Elle regroupe son activité dans des onglets isolés, peut utiliser DevTools, tester des apps web et accéder à des services authentifiés comme Gmail, Salesforce ou LinkedIn. Chaque nouveau domaine nécessite une confirmation explicite. Codex dépasse désormais les 4 millions d'utilisateurs actifs hebdomadaires — 8x de croissance depuis le début de l'année.
GPT-Realtime-2, Translate et Whisper: trois nouveaux modèles vocaux dans l'API
Le 7 mai, OpenAI a lancé trois modèles vocaux temps réel pour les développeurs. GPT-Realtime-2 est le premier avec un raisonnement de classe GPT-5 : il réfléchit avant de parler sur des requêtes complexes. GPT-Realtime-Translate traduit la parole en direct depuis 70+ langues vers 13 langues de sortie. GPT-Realtime-Whisper transcrit la parole en streaming en temps réel. Les trois sont disponibles dans l'API développeur.
Google I/O 2026 dans 5 jours — Gemini 4, Antigravity IDE et Gemini CLI
Google I/O 2026 commence le 19-20 mai avec un fort accent sur l'IA agentique. Attendus: Gemini 4 (successeur de Gemini 3.1 Pro, 94,3% GPQA Diamond), la Gemini Enterprise Agent Platform, Google Antigravity (IDE agentique en preview), et la Gemini CLI open-source. Les abonnés AI Pro ont déjà $10/mois en crédits Cloud; Ultra $100/mois.
Démarrer des tâches d'agent cloud Copilot via REST API
Le 13 mai, GitHub a ajouté la possibilité de démarrer des tâches d'agent cloud Copilot via l'API REST. Cela permet l'orchestration d'agents Copilot depuis des pipelines CI/CD, des scripts d'automatisation et des workflows externes sans intervention manuelle.
Types de commentaires de révision dans l'API de métriques d'usage
Le 8 mai, l'API de métriques Copilot a intégré la décomposition des suggestions de révision par type de commentaire, avec des comptages agrégés par catégorie et fréquence d'application — utile pour auditer l'adoption de Copilot Code Review avant la transition AI Credits du 1er juin.
Chronologie des Lancements de Modèles
| Date | Modèle | Fournisseur | Tier | Type | Notes |
|---|---|---|---|---|---|
| 2026-05-07 | GPT-Realtime-2 | OpenAI | A+ | Propriétaire | Premier modèle vocal avec raisonnement GPT-5. Réfléchit avant de répondre en audio. API développeur. |
| 2026-05-07 | GPT-Realtime-Translate | OpenAI | A | Propriétaire | Traduction vocale en direct: 70+ langues d'entrée vers 13 de sortie, au rythme de l'orateur. |
| 2026-05-07 | GPT-Realtime-Whisper | OpenAI | A | Propriétaire | Transcription vocale en streaming temps réel pendant que le locuteur parle. |
| 2026-05-06 | Grok 4.3 | xAI | A+ | Propriétaire | Dernière version Grok. Améliorations en raisonnement et codage. |
| 2026-05-05 | GPT-5.5 Instant | OpenAI | A+ | Propriétaire | Nouveau modèle par défaut de ChatGPT. 52,5% moins d'hallucinations que GPT-5.3 Instant. |
| 2026-04-27 | Qwen3.6-Max-Preview | Alibaba / Qwen | S | Propriétaire | Modèle propriétaire le plus puissant de Qwen. Domine 6 benchmarks de codage. Via Qwen Studio. |
| 2026-04-24 | DeepSeek-V4-Pro | DeepSeek | S | Ouvert | MoE 1,6T paramètres, contexte 1M tokens. $0,145/MTok entrée. Coding et agents. |
| 2026-04-24 | DeepSeek-V4-Flash | DeepSeek | A+ | Ouvert | 284B paramètres MoE, contexte 1M tokens. $0,14/$0,28 par MTok. Variante rapide de V4-Pro. |
| 2026-04-22 | Qwen3.6-27B | Alibaba / Qwen | A+ | Ouvert | Dense open-weight, 77,2 SWE-bench Verified. Surpasse Qwen3.5-397B MoE en coding. Apache 2.0. |
| 2026-04-20 | Kimi K2.6 | Moonshot / Kimi | A+ | Ouvert | 1T params (32B actifs). Agent Swarm: 300 sous-agents, 4000 étapes coordonnées. Licence MIT. |
| 2026-04-16 | Claude Opus 4.7 | Anthropic | S+ | Propriétaire | 64,3% SWE-bench Pro (n° 1 mondial). Niveau xhigh. Résolution image 3x. $5/$25 par MTok. |
Tendances Notables
La semaine consolide l'expansion des agents vers de nouveaux environnements: Claude Code avec Agent View pour gérer des sessions parallèles depuis la CLI, Codex dans Chrome pour accéder aux services web authentifiés, et désormais Copilot avec des agents cloud orchestrables via REST API. La question émergente est de savoir quand ces environnements convergeront.
OpenAI a divisé l'interface vocale en trois modèles spécialisés — raisonnement, traduction et transcription — au lieu d'un seul modèle généraliste. C'est un pari sur des verticales productives spécifiques (support client, conférence multilingue, dictée technique) nécessitant une latence ultra-faible.
Avec Google I/O dans cinq jours, l'écosystème est en mode anticipation: Gemini 3.1 Pro domine le raisonnement académique (94,3% GPQA Diamond), mais Gemini 4 et l'IDE Antigravity pourraient redéfinir le stack de développement IA agentique. La pression compétitive de DeepSeek V4-Pro maintient les labs occidentaux sous pression.