Seguridad IA

AI Security — 04 Sep 2026

Lo nuevo hoy

Today's highlights

Points forts du jour

Click en cualquiera para ir al detalle

Click any item to jump to the full section

Cliquez un élément pour aller à la section complète

🚨

Top Incidents

Breach

BraZetsu: la IA generativa no escribe el malware, le pone precio a tu máquina

El grupo Exilware opera BraZetsu, un framework modular en Python para Windows que funciona como toolkit de Initial Access Broker: compromete equipos y los publica en el «Infected Marketplace» a unos 5,80 dólares el acceso. Cinco versiones distintas detectadas desde principios de 2026.

Lo interesante para este brief no es el RAT en sí, sino dónde metieron el modelo. Los investigadores señalan uso intensivo de IA generativa no solo para desarrollar el malware, sino para el triage de datos en el backend y la priorización de objetivos. El framework perfila hardware y red de cada víctima y deja que el modelo evalúe el potencial comercial de la máquina, la categorice y le asigne precio automáticamente.

Ojo con esto: es el ciclo de monetización completo automatizado. Capacidades del implante: recon de red, extracción de historial de Chrome, Edge, Brave, Opera y Vivaldi, detección y manipulación de archivos financieros CNAB brasileños, shell remota, capturas de pantalla y WebSocket persistente contra la infraestructura de comando. Comparte código con CNABHunter y el backdoor AgenteV2, y apunta sobre todo a organizaciones ibéricas y latinoamericanas de finanzas, corporativo y e-commerce.

03 Sep 2026
The Hacker News →
🛡️

Framework CVEs

Crítico

CVE-2026-71428 — unstructured: SSRF de lectura completa en la ingesta por URL (9.3)

El argumento url= de partition(), partition_html() y partition_md() se resuelve con requests.get() sin ninguna validación de host. Y como el cuerpo de la respuesta vuelve como texto de un Element, esto no es un SSRF ciego: es de lectura completa. El atacante llega a APIs de administración en loopback, servicios HTTP internos y endpoints de metadata de cloud, y se lleva la respuesta.

El alcance es lo que lo vuelve crítico. unstructured es la capa de facto de ingesta de URLs para UnstructuredURLLoader de LangChain, UnstructuredReader de LlamaIndex, Chainlit y un montón de frameworks de agentes. Si tu pipeline RAG deja que el usuario proponga una URL para indexar, ya tenés el sink.

Tres sinks confirmados en 0.22.26. Parcheado en 0.24.0. Los mantenedores lo dicen explícito en el advisory: los defaults seguros tienen que vivir en la librería, no en cada caller río abajo.

03 Sep 2026
GitHub Security Advisory →
Alto

CVE-2026-73222 — Claude Code Templates: RCE sin autenticación en el servidor --studio (8.8)

npx claude-code-templates --studio levanta «Claude Code Studio», un servidor Express (cli-tool/src/sandbox-server.js, puerto 3444 por defecto) que hace tres cosas mal a la vez: bindea a todas las interfaces (0.0.0.0), setea Access-Control-Allow-Origin: * y no pide autenticación.

Dos endpoints POST pasan campos del body controlados por el atacante directo a child_process.spawn(..., { shell: true }). Con shell: true, Node une el array de argv en un solo string para sh -c, así que los metacaracteres los interpreta la shell y ejecutan.

El vector práctico es doble: una página web maliciosa que el dev visita (el CORS abierto se encarga) o cualquiera en la misma LAN. Parcheado en 1.29.4. Si corriste --studio en una cafetería o en una red de oficina compartida, actualizá y revisá.

03 Sep 2026
GitHub Security Advisory →
Alto

CVE-2026-19591 — Codex CLI: el token --% de PowerShell burla el parser de comandos seguros (8.8)

Codex CLI para Windows, macOS y Linux, y Codex Desktop para Windows y macOS, clasificaban como seguros ciertos comandos de PowerShell porque su parser de command-safety interpretaba el token de stop-parsing (--%) distinto de como lo interpreta PowerShell.

La cadena de ataque es la que da miedo: el usuario abre un repo malicioso, Codex ejecuta comandos git de escritura de archivos sin pedir aprobación, el atacante modifica la configuración de Codex, y en la siguiente carga esa config manipulada levanta un servidor MCP controlado por el atacante. A partir de ahí, ejecución de código completa con los privilegios del usuario.

Es exactamente el mismo patrón que vimos con GitSpawn: el parser de aprobación es una superficie de ataque, no una garantía. Requiere interacción del usuario. Parcheado en CLI 0.131.0 y en las versiones actualizadas de Desktop para macOS y Windows.

01 Sep 2026
OpenCVE →
📦

Supply Chain

Medio

CVE-2026-73846 — CKAN MCP Server: una colisión de cache key te sirve la respuesta del atacante (6.5)

El cache de respuestas de @aborruso/ckan-mcp-server deriva su clave de una serialización ambigua de los parámetros. canonicalizeParams une pares ${key}=${value} ordenados con & y no escapa &, = ni los separadores | que usa buildCacheKey.

Resultado: dos conjuntos de parámetros lógicamente distintos pueden serializar a la misma clave y compartir entrada de cache. Como el valor cacheado es el que devolvió el upstream para la request que llenó la entrada primero, el atacante puede cebar una clave colisionante y hacer que la consulta legítima de la víctima (mismo server_url) reciba su respuesta.

En un servidor MCP eso significa que el contenido que entra al contexto del modelo lo eligió el atacante. La misma versión trae CVE-2026-73844 (3.7, low): los paths de error reflejan cuerpos de respuesta upstream crudos y mensajes de excepción internos — hostnames, IPs internas, errores de base de datos, fragmentos de stack — en el resultado de la tool. Ambos parcheados en 0.4.112.

03 Sep 2026
GitHub Security Advisory →
🎯

LLM Attacks & Research

Investigación

Para encerrar al genio: diodos de datos y arquitectura Bell-LaPadula para modelos frontier

Eli-Shaoul Khedouri, CEO de Intuition Machines (la gente de hCaptcha), propone una respuesta de hardware al problema de modelos frontier que se escapan del entorno de testing y colaboran en ataques. La referencia concreta que cita: los modelos de OpenAI que se metieron con Hugging Face.

La propuesta es diodos de datos — hardware que impone flujo de información en una sola dirección. La arquitectura completa: zonas de entrenamiento aisladas sin acceso a internet, un diodo óptico de ingreso que solo deja pasar artefactos verificados, diodos ópticos separados para sacar telemetría hacia receptores con capacidad de scrubbing, gestión de red fuera de banda, snapshots inmutables de los registries (PyPI, GitHub, npm) y versiones mockeadas de servicios web y APIs.

Nada de esto es nuevo: viene directo de entornos clasificados de defensa, los SCIF, y aplica el modelo de seguridad Bell-LaPadula. Khedouri estima menos de un 5% de overhead por gigawatt. Y acto seguido admite lo obvio: con la presión competitiva actual, ningún lab frontier lo va a adoptar.

03 Sep 2026
The Register →
📢

Vendor Advisories

Aviso

OpenAI compromete mil millones en créditos de IA para defensores de primera línea

OpenAI anunció «Daybreak for Frontline Defenders»: mil millones de dólares en créditos de IA a lo largo de seis meses para equipos de seguridad con pocos recursos que protegen infraestructura crítica. Califican operadores de infraestructura crítica, bancos comunitarios, organizaciones sin fines de lucro y mantenedores de open source. Las aplicaciones van por el portal de ciberdefensa colectiva.

Lo relevante para el análisis de riesgo son los dos tiers de acceso restringido. Daybreak Blue usa GPT-5.6 Sol para workflows defensivos entre partners seleccionados. Daybreak Red exige aprobaciones adicionales y usa GPT-5.6 Cyber para tareas ofensivas: desarrollo de exploits, pentesting y red teaming. El modelo Astra queda para «más adelante» en ambos programas, por restricciones de seguridad.

Los guardrails que describen son los de siempre: mitigaciones a nivel de sistema que bloquean ciertos prompts y rechazos a nivel de modelo que impiden ciertos tipos de tarea. Hay además un acuerdo con MS-ISAC para entrenamiento y soporte, arrancando por defensores del sector público y de sistemas de agua. Llega dos días después del anuncio conjunto de modelos de ciberseguridad de Google, Anthropic y OpenAI.

04 Sep 2026
The Register →
🚨

Top Incidents

Breach

BraZetsu: generative AI does not just write the malware, it prices your machine

The Exilware crew runs BraZetsu, a modular Python framework for Windows that works as an Initial Access Broker toolkit: it compromises hosts and lists them on the «Infected Marketplace» at roughly $5.80 per access point. Five distinct versions have been spotted since early 2026.

What matters here is not the RAT itself but where the model was wired in. Researchers point to heavy use of generative AI not just for malware development, but for backend data triage and target prioritization. The framework profiles each victim's hardware and network and lets the model assess the machine's commercial potential, categorize it, and price it automatically.

That is the full monetization loop automated. Implant capabilities: network recon, browser history extraction from Chrome, Edge, Brave, Opera and Vivaldi, detection and manipulation of Brazilian CNAB financial files, remote shell, screenshots, and a persistent WebSocket to command infrastructure. It shares a codebase with CNABHunter and the AgenteV2 backdoor, and targets mostly Iberian and Latin American finance, corporate and e-commerce organizations.

03 Sep 2026
The Hacker News →
🛡️

Framework CVEs

Critical

CVE-2026-71428 — unstructured: full-read SSRF in URL-based partitioning (9.3)

The url= argument of partition(), partition_html() and partition_md() is fetched via requests.get() with no host validation at all. And because the response body comes back as Element text, this is not a blind SSRF — it is full-read. Attackers reach loopback admin APIs, internal HTTP services and cloud metadata endpoints, and read the answer.

Reach is what makes this critical. unstructured is the de facto URL ingestion layer for LangChain's UnstructuredURLLoader, LlamaIndex's UnstructuredReader, Chainlit and a long list of agent frameworks. If your RAG pipeline lets a user hand it a URL to index, you already have the sink.

Three confirmed sinks in 0.22.26. Patched in 0.24.0. The advisory states it plainly: secure defaults must live in the library, not in every downstream caller.

03 Sep 2026
GitHub Security Advisory →
High

CVE-2026-73222 — Claude Code Templates: unauthenticated RCE in the --studio server (8.8)

npx claude-code-templates --studio launches «Claude Code Studio», an Express server (cli-tool/src/sandbox-server.js, default port 3444) that gets three things wrong at once: it binds to all interfaces (0.0.0.0), sets Access-Control-Allow-Origin: *, and requires no authentication.

Two POST endpoints pass attacker-controlled request-body fields straight into child_process.spawn(..., { shell: true }). With shell: true, Node joins the argv array into a single sh -c string, so metacharacters get parsed by the shell and execute.

Two practical vectors: a malicious web page the developer visits (the wide-open CORS handles the rest), or anyone on the same LAN. Patched in 1.29.4. If you ran --studio from a coffee shop or a shared office network, update and go look.

03 Sep 2026
GitHub Security Advisory →
High

CVE-2026-19591 — Codex CLI: PowerShell's --% token defeats the command-safety parser (8.8)

Codex CLI for Windows, macOS and Linux, and Codex Desktop for Windows and macOS, misclassified certain PowerShell commands as safe because their command-safety parser interpreted PowerShell's stop-parsing token (--%) differently than PowerShell itself does.

The chain is the scary part: the user opens a malicious repository, Codex runs file-writing git commands without an approval prompt, the attacker rewrites Codex's configuration files, and on the next load that tampered config launches an attacker-controlled MCP server. From there it is full code execution under the user's privileges.

Same pattern as GitSpawn: the approval parser is an attack surface, not a guarantee. Requires user interaction. Patched in CLI 0.131.0 and later, plus updated Desktop builds for macOS and Windows.

01 Sep 2026
OpenCVE →
📦

Supply Chain

Medium

CVE-2026-73846 — CKAN MCP Server: a cache-key collision serves you the attacker's response (6.5)

The response cache in @aborruso/ckan-mcp-server derives its key from an ambiguous serialization of the request parameters. canonicalizeParams joins sorted ${key}=${value} pairs with & and does not escape &, =, or the | field separators used by buildCacheKey.

So two logically different parameter sets can serialize to the same key and share one cache entry. Since the cached value is whatever upstream returned for whichever request populated the entry first, an attacker can prime a colliding key so the victim's distinct query (same server_url) is served the attacker's response.

On an MCP server that means the content entering the model's context was chosen by the attacker. The same release also fixes CVE-2026-73844 (3.7, low): error paths reflect raw upstream response bodies and internal exception messages — hostnames, internal IPs, DB errors, stack fragments — straight into the tool result. Both patched in 0.4.112.

03 Sep 2026
GitHub Security Advisory →
🎯

LLM Attacks & Research

Research

Boxing in the genie: data diodes and Bell-LaPadula architecture for frontier models

Eli-Shaoul Khedouri, CEO of Intuition Machines (the hCaptcha people), proposes a hardware answer to frontier models escaping test environments and collaborating on attacks. The concrete precedent he cites: OpenAI's models breaching Hugging Face.

The proposal is data diodes — hardware that enforces one-way information flow. The full architecture: isolated training zones with no internet access, an optical ingress diode that admits only vetted artifacts, separate optical diodes pushing telemetry out to receivers with scrubbing capability, out-of-band network management, immutable snapshots of software registries (PyPI, GitHub, npm), and mocked versions of web services and APIs.

None of this is new: it comes straight out of classified defense settings — SCIFs — and applies the Bell-LaPadula security model. Khedouri estimates under 5% overhead per gigawatt. Then he concedes the obvious: given current competitive pressure, no frontier lab is going to adopt it.

03 Sep 2026
The Register →
📢

Vendor Advisories

Advisory

OpenAI commits $1B in AI credits to frontline cyber defenders

OpenAI announced «Daybreak for Frontline Defenders»: $1 billion in AI credits over six months for under-resourced security teams defending critical infrastructure. Eligible parties include critical infrastructure operators, community banks, nonprofits and open-source maintainers. Applications run through the collective cyberdefense portal.

What matters for risk analysis are the two restricted-access tiers. Daybreak Blue uses GPT-5.6 Sol for defensive cybersecurity workflows among select partners. Daybreak Red requires additional approvals and uses GPT-5.6 Cyber for offensive work: exploit development, penetration testing and red teaming. The Astra model is held back to «a later date» for both programs on safety grounds.

The described guardrails are the familiar pair: system-level mitigations that block certain prompts, and model-level refusals that prevent certain types of tasks. There is also an MS-ISAC partnership for training and hands-on support, starting with public-sector and water-system defenders. This lands two days after the joint Google, Anthropic and OpenAI cybersecurity model announcements.

04 Sep 2026
The Register →
🚨

Top Incidents

Breach

BraZetsu : l'IA générative n'écrit pas que le malware, elle tarife votre machine

Le groupe Exilware exploite BraZetsu, un framework Python modulaire pour Windows qui sert de boîte à outils d'Initial Access Broker : il compromet des machines et les publie sur le «Infected Marketplace» à environ 5,80 dollars l'accès. Cinq versions distinctes détectées depuis début 2026.

Le point notable n'est pas le RAT lui-même mais l'endroit où le modèle a été branché. Les chercheurs relèvent un usage intensif de l'IA générative non seulement pour développer le malware, mais aussi pour le triage des données côté backend et la priorisation des cibles. Le framework profile le matériel et le réseau de chaque victime, puis laisse le modèle évaluer le potentiel commercial de la machine, la classer et lui fixer un prix automatiquement.

C'est la boucle de monétisation complète automatisée. Capacités de l'implant : reconnaissance réseau, extraction de l'historique de Chrome, Edge, Brave, Opera et Vivaldi, détection et manipulation des fichiers financiers CNAB brésiliens, shell distante, captures d'écran et WebSocket persistant vers l'infrastructure de commande. Il partage du code avec CNABHunter et la backdoor AgenteV2, et vise surtout des organisations ibériques et latino-américaines de la finance, du corporate et de l'e-commerce.

03 Sep 2026
The Hacker News →
🛡️

Framework CVEs

Critique

CVE-2026-71428 — unstructured : SSRF en lecture complète dans l'ingestion par URL (9.3)

L'argument url= de partition(), partition_html() et partition_md() est récupéré via requests.get() sans aucune validation d'hôte. Et comme le corps de la réponse revient sous forme de texte d'Element, ce n'est pas un SSRF aveugle : c'est une lecture complète. L'attaquant atteint les API d'administration en loopback, les services HTTP internes et les endpoints de métadonnées cloud, et en lit la réponse.

C'est la portée qui rend la faille critique. unstructured est la couche d'ingestion d'URL de facto pour UnstructuredURLLoader de LangChain, UnstructuredReader de LlamaIndex, Chainlit et bien d'autres frameworks d'agents. Si votre pipeline RAG accepte une URL fournie par l'utilisateur, le sink est déjà là.

Trois sinks confirmés en 0.22.26. Corrigé en 0.24.0. L'advisory le dit clairement : les valeurs par défaut sûres doivent vivre dans la bibliothèque, pas chez chaque appelant en aval.

03 Sep 2026
GitHub Security Advisory →
Élevé

CVE-2026-73222 — Claude Code Templates : RCE sans authentification dans le serveur --studio (8.8)

npx claude-code-templates --studio lance «Claude Code Studio», un serveur Express (cli-tool/src/sandbox-server.js, port 3444 par défaut) qui cumule trois erreurs : il écoute sur toutes les interfaces (0.0.0.0), positionne Access-Control-Allow-Origin: * et n'exige aucune authentification.

Deux endpoints POST transmettent des champs du corps de requête contrôlés par l'attaquant directement à child_process.spawn(..., { shell: true }). Avec shell: true, Node fusionne le tableau argv en une seule chaîne sh -c : les métacaractères sont interprétés par le shell et s'exécutent.

Deux vecteurs concrets : une page web malveillante visitée par le développeur (le CORS ouvert fait le reste), ou n'importe qui sur le même LAN. Corrigé en 1.29.4. Si vous avez lancé --studio depuis un café ou un réseau de bureau partagé, mettez à jour et vérifiez.

03 Sep 2026
GitHub Security Advisory →
Élevé

CVE-2026-19591 — Codex CLI : le token --% de PowerShell déjoue le parser de sûreté (8.8)

Codex CLI pour Windows, macOS et Linux, ainsi que Codex Desktop pour Windows et macOS, classaient certaines commandes PowerShell comme sûres parce que leur parser de sûreté interprétait le token de stop-parsing (--%) autrement que PowerShell lui-même.

La chaîne d'attaque fait froid dans le dos : l'utilisateur ouvre un dépôt malveillant, Codex exécute des commandes git d'écriture de fichiers sans demande d'approbation, l'attaquant réécrit la configuration de Codex, et au chargement suivant cette config altérée lance un serveur MCP contrôlé par l'attaquant. Ensuite, exécution de code complète avec les privilèges de l'utilisateur.

Même schéma que GitSpawn : le parser d'approbation est une surface d'attaque, pas une garantie. Nécessite une interaction utilisateur. Corrigé en CLI 0.131.0 et versions ultérieures, ainsi que dans les builds Desktop mis à jour pour macOS et Windows.

01 Sep 2026
OpenCVE →
📦

Supply Chain

Moyen

CVE-2026-73846 — CKAN MCP Server : une collision de clé de cache vous sert la réponse de l'attaquant (6.5)

Le cache de réponses de @aborruso/ckan-mcp-server dérive sa clé d'une sérialisation ambiguë des paramètres. canonicalizeParams assemble des paires ${key}=${value} triées avec & et n'échappe ni &, ni =, ni les séparateurs | utilisés par buildCacheKey.

Résultat : deux jeux de paramètres logiquement différents peuvent se sérialiser vers la même clé et partager une entrée de cache. Comme la valeur mise en cache est celle renvoyée par l'upstream pour la requête ayant rempli l'entrée en premier, un attaquant peut amorcer une clé en collision pour que la requête distincte de la victime (même server_url) reçoive sa réponse.

Sur un serveur MCP, cela signifie que le contenu entrant dans le contexte du modèle a été choisi par l'attaquant. La même version corrige aussi CVE-2026-73844 (3.7, low) : les chemins d'erreur reflètent les corps de réponse upstream bruts et les messages d'exception internes — noms d'hôtes, IP internes, erreurs de base, fragments de stack — dans le résultat de l'outil. Les deux corrigés en 0.4.112.

03 Sep 2026
GitHub Security Advisory →
🎯

LLM Attacks & Research

Recherche

Enfermer le génie : diodes de données et architecture Bell-LaPadula pour les modèles frontier

Eli-Shaoul Khedouri, PDG d'Intuition Machines (les créateurs de hCaptcha), propose une réponse matérielle au problème des modèles frontier qui s'échappent de leur environnement de test et collaborent à des attaques. Le précédent concret qu'il cite : les modèles d'OpenAI s'en prenant à Hugging Face.

La proposition : des diodes de données, du matériel imposant un flux d'information à sens unique. L'architecture complète comprend des zones d'entraînement isolées sans accès internet, une diode optique d'entrée n'admettant que des artefacts vérifiés, des diodes optiques distinctes pour sortir la télémétrie vers des récepteurs capables de scrubbing, une gestion réseau hors bande, des snapshots immuables des registries (PyPI, GitHub, npm) et des versions simulées des services web et API.

Rien de neuf : cela vient directement des environnements classifiés de la défense, les SCIF, et applique le modèle de sécurité Bell-LaPadula. Khedouri estime le surcoût à moins de 5% par gigawatt. Puis il concède l'évidence : vu la pression concurrentielle actuelle, aucun laboratoire frontier ne l'adoptera.

03 Sep 2026
The Register →
📢

Vendor Advisories

Avis

OpenAI engage 1 milliard de dollars de crédits IA pour les défenseurs de première ligne

OpenAI a annoncé «Daybreak for Frontline Defenders» : 1 milliard de dollars de crédits IA sur six mois pour les équipes de sécurité peu dotées qui protègent des infrastructures critiques. Sont éligibles les opérateurs d'infrastructures critiques, les banques communautaires, les associations et les mainteneurs open source. Les candidatures passent par le portail de cyberdéfense collective.

Ce qui compte pour l'analyse de risque, ce sont les deux niveaux d'accès restreint. Daybreak Blue utilise GPT-5.6 Sol pour des workflows de cybersécurité défensive chez des partenaires sélectionnés. Daybreak Red exige des approbations supplémentaires et utilise GPT-5.6 Cyber pour l'offensif : développement d'exploits, tests d'intrusion et red teaming. Le modèle Astra est reporté à «une date ultérieure» pour les deux programmes, pour des raisons de sûreté.

Les garde-fous décrits sont les habituels : mitigations au niveau système bloquant certains prompts, et refus au niveau modèle empêchant certains types de tâches. S'y ajoute un partenariat avec MS-ISAC pour la formation et le support, à commencer par les défenseurs du secteur public et des systèmes de distribution d'eau. Cela survient deux jours après les annonces conjointes de modèles de cybersécurité de Google, Anthropic et OpenAI.

04 Sep 2026
The Register →