Claude Code corrige une fuite NTLM, Copilot ajoute les canvases, et Qwen3.8-27B domine Hugging Face
v2.1.234: hardening contra NTLM, badges de GitLab MR y auto-continuación de sesión
Corrección de seguridad: las lecturas de archivos remotos, la restauración de sesión, los includes de CLAUDE.md y las cargas de archivos ahora rechazan rutas con namespace NT de Windows, cerrando un vector de fuga de credenciales NTLM. Se suma un badge de merge request de GitLab en el footer/statusline (MR !N con estado draft/pending/verde vía glab), las sesiones se retoman solas cuando se reinicia un límite de uso de claude.ai, y se agrega la variable CLAUDE_CODE_PROJECT_DIR_NAME para directorios de transcript por proyecto en hosts multi-tenant.
«Canvases»: superficie compartida para trabajo agéntico
La app de Copilot suma canvases: una superficie persistente y compartida para seguir trabajo agéntico de varios pasos en vez de perder el estado en el scroll del chat. Rastrea fases, reduce prompting repetido y agrega checkpoints de aprobación humana; GitHub estima un costo de 2.000-3.000 créditos por canvas en los dos casos de uso mostrados (modernización de código Java y un «Site Studio»).
5 capacidades nuevas de Claude en Foundry: Structured Outputs, Web Search/Fetch, MCP Connector y Tool Search
Los despliegues de Claude en Azure vía Microsoft Foundry suman: Structured Outputs (JSON válido garantizado por gramática), Web Search y Web Fetch (búsqueda y lectura autónoma de páginas/PDFs con citas), MCP Connector (conexión directa a servidores MCP como Jira o ServiceNow con listas de permitidos/bloqueados), y Tool Search (carga solo las tools que el modelo necesita de un catálogo grande, recortando tokens de definición de tools en más de 85%). Resuelve el trade-off previo entre features agénticas y residencia de datos.
Origin: hosting de código propio, agent-first, en beta temprana
Cursor lanza Origin, plataforma de hosting de código agent-first en beta temprana para todos los planes pagos (las orgs enterprise pueden optar por no usarla). Combina hosting de repos, revisión/merge de pull requests, sincronización bidireccional en tiempo real con GitHub, navegación de código e integraciones de CI/deploy con Vercel, Depot y Buildkite — una apuesta directa por infraestructura pensada para agentes de codificación con IA.
Línea de Tiempo — Lanzamientos de Modelos
| Fecha | Modelo | Proveedor | Tier | Tipo | Notas |
|---|---|---|---|---|---|
| 2026-08-14 | Qwen3.8-27B | Alibaba / Qwen | A | Abierto | Segundo checkpoint de Qwen3.8-Max en open weights (Apache 2.0), 27B con soporte visión-lenguaje nativo, contexto de 262K (extensible a 1M). Terminal-Bench 2.1: 73.0, SWE-bench Pro: 61.7, GPQA Diamond: 89.2, OSWorld-Verified: 84.3. Lideró el trending global de Hugging Face con más de 1M de descargas en dos días. |
| 2026-08-14 | GLM-5.3 | Z.ai / Zhipu | A | Propietario | Mejora sobre la misma base de 743B de GLM-5.2 vía post-entrenamiento escalado, sin reentrenar el modelo base. Terminal-Bench 3.0 sube de 4.6 a 28.3, DeepSWE v1.1 de 46.2 a 66.9, CyberGym llega a 84.5%. Disponible vía API de Z.ai, GLM Coding Plan y ZCode; pesos abiertos prometidos ~2 semanas después de evaluaciones de seguridad. |
| 2026-08 | GPT-6 "Astra" | OpenAI | S+ | Próximo | Nombre confirmado el 1 de agosto junto a diez problemas de matemáticas/CS resueltos; sin fecha de lanzamiento, precio ni model card al 18 de agosto. |
| 2026-11 | OpenAI "Doug" | OpenAI | S | Próximo | El mayor pre-entrenamiento de OpenAI desde 2024; sigue en entrenamiento/testing, apuntando a noviembre de 2026. |
| 2026-09 | Grok 4.7 | xAI | S+ | Próximo | Modelo de 2.1T anunciado por Musk como sucesor de Grok 4.6; entrenamiento base completo, corrida suplementaria con datos de SpaceX en curso. Apunta a inicios/mediados de septiembre de 2026, sin fecha firme. |
| 2026-08 | Claude Fable 5.1 | Anthropic | S | Próximo | Rumor persistente desde fines de julio, apuntando a agosto en simultáneo con GPT-6; Anthropic no confirmó nada oficialmente al 18 de agosto. |
Tendencias Destacadas
Los cuatro días desde el último brief fueron flojos para los 5 core tools pero activos en la capa adyacente: Microsoft profundizó las capacidades agénticas de Claude dentro de Foundry, Copilot mostró una superficie persistente («canvases») para trabajo agéntico, y Cursor hizo una jugada agresiva lanzando su propio hosting de código — tres señales de que los proveedores compiten por poseer la capa de orquestación e infraestructura de agentes, no solo la capa de modelo.
En modelos, la semana fue de post-entrenamiento más que de nuevas bases: tanto GLM-5.3 como Qwen3.8-27B mejoraron sobre arquitecturas ya conocidas en vez de reentrenar desde cero, y el checkpoint más chico de Qwen (27B, en open weights) terminó dominando el trending de Hugging Face por sobre modelos propietarios más grandes — otra señal de que el open weight bien afinado compite de cerca incluso sin ser el modelo insignia.
v2.1.234: NTLM path hardening, GitLab MR badges, and session auto-continue
Security fix: remote file reads, session restore, CLAUDE.md includes, and file uploads now reject Windows NT-namespace paths, closing an NTLM credential-leak vector. Adds a GitLab merge-request badge in the footer/statusline (MR !N with draft/pending/green state via glab), sessions now auto-continue when a claude.ai usage limit resets, and a new CLAUDE_CODE_PROJECT_DIR_NAME env var enables per-project transcript directories on multi-tenant hosts.
"Canvases": a shared surface for agentic work
The Copilot app adds canvases: a durable, shared surface for tracking multi-step agent work instead of losing state in chat scroll. It tracks phases, cuts down on repeated prompting, and adds human approval checkpoints; GitHub estimates roughly 2,000-3,000 credits per canvas across the two showcased builds (a Java Modernization Studio and a Site Studio).
5 new Claude capabilities in Foundry: Structured Outputs, Web Search/Fetch, MCP Connector, and Tool Search
Claude deployments on Azure via Microsoft Foundry gain: Structured Outputs (grammar-constrained, guaranteed-valid JSON), Web Search and Web Fetch (autonomous page/PDF search and reading with citations), MCP Connector (direct connection to MCP servers like Jira or ServiceNow with tool allow/deny-lists), and Tool Search (loads only the tools the model needs from a large catalog, cutting tool-definition tokens by 85%+). This resolves the prior trade-off between agentic features and data-residency requirements.
Origin: its own agent-first code hosting, in early beta
Cursor launches Origin, an agent-first code hosting platform in early beta for all paid plans (enterprise orgs can opt out). It bundles repo hosting, pull request review/merge, real-time bidirectional GitHub sync, code browsing, and CI/deploy integrations with Vercel, Depot, and Buildkite — a direct play at infrastructure built for AI coding agents.
Model Launches Timeline
| Date | Model | Provider | Tier | Type | Notes |
|---|---|---|---|---|---|
| 2026-08-14 | Qwen3.8-27B | Alibaba / Qwen | A | Open | Second open-weight (Apache 2.0) checkpoint off Qwen3.8-Max, 27B with native vision-language support, 262K context (extensible to 1M). Terminal-Bench 2.1: 73.0, SWE-bench Pro: 61.7, GPQA Diamond: 89.2, OSWorld-Verified: 84.3. Topped Hugging Face's global trending chart with 1M+ downloads in two days. |
| 2026-08-14 | GLM-5.3 | Z.ai / Zhipu | A | Proprietary | Upgrade over the same 743B GLM-5.2 base via scaled post-training, without retraining the base model. Terminal-Bench 3.0 climbs from 4.6 to 28.3, DeepSWE v1.1 from 46.2 to 66.9, CyberGym reaches 84.5%. Live via the Z.ai API, GLM Coding Plan, and ZCode; open weights promised roughly two weeks out pending safety evaluations. |
| 2026-08 | GPT-6 "Astra" | OpenAI | S+ | Upcoming | Name confirmed Aug 1 alongside ten solved math/CS problems; no release date, pricing, or model card as of Aug 18. |
| 2026-11 | OpenAI "Doug" | OpenAI | S | Upcoming | OpenAI's largest pre-training run since 2024; still in training/testing, targeted for November 2026. |
| 2026-09 | Grok 4.7 | xAI | S+ | Upcoming | 2.1T model teased by Musk as Grok 4.6's successor; base training complete, supplemental SpaceX-data run underway. Targeting early-to-mid September 2026, no firm date. |
| 2026-08 | Claude Fable 5.1 | Anthropic | S | Upcoming | Persistent rumor since late July, targeting August alongside GPT-6; Anthropic has made no official announcement as of Aug 18. |
Notable Trends
The four days since the last brief were quiet on the 5 core tools but busy at the adjacent layer: Microsoft deepened Claude's agentic toolset inside Foundry, Copilot shipped a persistent surface ("canvases") for agentic work, and Cursor made an aggressive play by launching its own code hosting — three signals that vendors are racing to own the agent orchestration and infrastructure layer, not just the model layer.
On the model side, the week was about post-training rather than new foundations: both GLM-5.3 and Qwen3.8-27B improved on already-known architectures instead of retraining from scratch, and Qwen's smaller checkpoint (27B, open-weight) ended up dominating Hugging Face's trending chart over larger proprietary models — another sign that a well-tuned open-weight release competes closely even without being the flagship.
v2.1.234 : durcissement contre NTLM, badges GitLab MR et reprise automatique de session
Correctif de sécurité : les lectures de fichiers distants, la restauration de session, les includes CLAUDE.md et les téléversements de fichiers rejettent désormais les chemins à namespace NT de Windows, fermant un vecteur de fuite d'identifiants NTLM. Ajout d'un badge de merge request GitLab dans le footer/statusline (MR !N avec état draft/pending/vert via glab), les sessions reprennent automatiquement quand une limite d'usage claude.ai se réinitialise, et une nouvelle variable CLAUDE_CODE_PROJECT_DIR_NAME permet des répertoires de transcript par projet sur des hôtes multi-tenant.
« Canvases » : une surface partagée pour le travail agentique
L'app Copilot ajoute les canvases : une surface durable et partagée pour suivre un travail d'agent en plusieurs étapes au lieu de perdre l'état dans le défilement du chat. Elle suit les phases, réduit le prompting répété et ajoute des points de validation humaine ; GitHub estime un coût d'environ 2 000 à 3 000 crédits par canvas sur les deux builds présentés (un Java Modernization Studio et un Site Studio).
5 nouvelles capacités Claude dans Foundry : Structured Outputs, Web Search/Fetch, MCP Connector et Tool Search
Les déploiements de Claude sur Azure via Microsoft Foundry gagnent : Structured Outputs (JSON valide garanti par contraintes de grammaire), Web Search et Web Fetch (recherche et lecture autonomes de pages/PDF avec citations), MCP Connector (connexion directe à des serveurs MCP comme Jira ou ServiceNow avec listes d'autorisation/blocage d'outils), et Tool Search (ne charge que les outils nécessaires depuis un grand catalogue, réduisant les tokens de définition d'outils de plus de 85%). Cela résout l'arbitrage précédent entre fonctionnalités agentiques et exigences de résidence des données.
Origin : son propre hébergement de code agent-first, en bêta précoce
Cursor lance Origin, une plateforme d'hébergement de code agent-first en bêta précoce pour tous les plans payants (les organisations enterprise peuvent s'en exclure). Elle regroupe l'hébergement de dépôts, la revue/fusion de pull requests, une synchronisation GitHub bidirectionnelle en temps réel, la navigation de code et des intégrations CI/déploiement avec Vercel, Depot et Buildkite — un pari direct sur une infrastructure pensée pour les agents de codage IA.
Chronologie des Lancements de Modèles
| Date | Modèle | Fournisseur | Tier | Type | Notes |
|---|---|---|---|---|---|
| 2026-08-14 | Qwen3.8-27B | Alibaba / Qwen | A | Ouvert | Second checkpoint en poids ouverts (Apache 2.0) issu de Qwen3.8-Max, 27B avec support vision-langage natif, contexte de 262K (extensible à 1M). Terminal-Bench 2.1 : 73.0, SWE-bench Pro : 61.7, GPQA Diamond : 89.2, OSWorld-Verified : 84.3. A dominé le trending global de Hugging Face avec plus d'1M de téléchargements en deux jours. |
| 2026-08-14 | GLM-5.3 | Z.ai / Zhipu | A | Propriétaire | Amélioration sur la même base de 743B que GLM-5.2 via un post-entraînement à plus grande échelle, sans réentraîner le modèle de base. Terminal-Bench 3.0 passe de 4.6 à 28.3, DeepSWE v1.1 de 46.2 à 66.9, CyberGym atteint 84.5%. Disponible via l'API Z.ai, le GLM Coding Plan et ZCode ; poids ouverts promis environ deux semaines plus tard, après évaluations de sécurité. |
| 2026-08 | GPT-6 "Astra" | OpenAI | S+ | À venir | Nom confirmé le 1er août avec dix problèmes de maths/informatique résolus ; aucune date de sortie, prix ni fiche modèle au 18 août. |
| 2026-11 | OpenAI "Doug" | OpenAI | S | À venir | Le plus grand pré-entraînement d'OpenAI depuis 2024 ; toujours en entraînement/test, visé pour novembre 2026. |
| 2026-09 | Grok 4.7 | xAI | S+ | À venir | Modèle de 2.1T annoncé par Musk comme successeur de Grok 4.6 ; entraînement de base terminé, run supplémentaire avec données SpaceX en cours. Visé pour début-mi septembre 2026, sans date ferme. |
| 2026-08 | Claude Fable 5.1 | Anthropic | S | À venir | Rumeur persistante depuis fin juillet, visant août en parallèle de GPT-6 ; Anthropic n'a fait aucune annonce officielle au 18 août. |
Tendances Notables
Les quatre jours depuis le dernier brief ont été calmes pour les 5 outils principaux mais actifs à la couche adjacente : Microsoft a approfondi la boîte à outils agentique de Claude dans Foundry, Copilot a livré une surface persistante (« canvases ») pour le travail agentique, et Cursor a fait un pari agressif en lançant son propre hébergement de code — trois signaux que les fournisseurs se disputent la couche d'orchestration et d'infrastructure des agents, pas seulement la couche modèle.
Côté modèles, la semaine a porté sur le post-entraînement plutôt que sur de nouvelles bases : GLM-5.3 comme Qwen3.8-27B se sont améliorés sur des architectures déjà connues plutôt que de réentraîner depuis zéro, et le plus petit checkpoint de Qwen (27B, en poids ouverts) a fini par dominer le trending de Hugging Face devant des modèles propriétaires plus grands — un autre signe qu'une version en poids ouverts bien ajustée rivalise de près même sans être le modèle phare.