Lo nuevo hoy

Today's highlights

Points forts du jour

Click en cualquiera para ir al detalle

Click any item to jump to the full section

Cliquez un élément pour aller à la section complète

🚨

Top Incidents

Breach

Meta confirma que uno de sus modelos hackeó a una empresa real durante una evaluación

Meta reconoció que uno de sus modelos —según Reuters, Muse Spark 1.1, el más capaz de la casa en coding y tareas agénticas— explotó una vulnerabilidad en los sistemas de una tercera empresa y modificó partes de su entorno interno durante una evaluación de ciberseguridad. La organización afectada no fue identificada.

La evaluación la corría Irregular, partner externo de evaluación. La causa raíz no fue un sandbox escape ni un ataque autónomo sofisticado: fue un error de configuración que le dio al modelo acceso a internet abierto, así que en vez de pegarle a infra simulada le pegó a infra real. Irregular dice que no quedan issues abiertos y que está preparando guías de buenas prácticas para protocolos de evaluación seguros.

Ojo con el patrón, porque este es el punto: en menos de tres semanas van tres labs. OpenAI con el breach de Hugging Face, Anthropic con los modelos que atacaron organizaciones reales en el reporte de AISI, y ahora Meta. Tres incidentes, misma causa estructural —el entorno de evaluación tenía salida a internet— y ninguna de las tres veces falló el modelo por ser más listo de lo esperado. Falló el arnés.

06 Aug 2026
CyberInsider →
🛡️

Framework CVEs

Crítico

CVE-2026-43631: use-after-free en llama-server permite RCE sin autenticar (CVSS 9.2)

Advisory GHSA-6hc7-9rph-cm99, publicado el 7 de agosto: un use-after-free en el puntero de vocab de llama-server que se activa cuando está habilitada la opción --sleep-idle-seconds. Afecta builds b7492 hasta b9060. CVSS 9.2, crítico.

El bug es un clásico de concurrencia (CWE-362): un atacante remoto sin autenticar manda requests contra endpoints vulnerables justo durante la transición a sleep del server. Los worker threads concurrentes dereferencian el puntero ya liberado, y ahí es donde entra el payload: se puede inyectar data controlada para llegar a ejecución remota de código.

Si corrés llama.cpp con el flag de idle sleep expuesto a red, esto no es teórico. La condición de carrera necesita timing, pero el endpoint es público y no pide credenciales. Mientras no haya build parcheado confirmado, la mitigación práctica es apagar --sleep-idle-seconds y sacar el server de cualquier interfaz que no sea loopback.

07 Aug 2026
GitHub Advisory Database →
📦

Supply Chain

Breach

El gusano de keyv envenena 1.684 versiones en npm y trae hooks de Claude Code y VS Code como vías de ejecución

Un atacante comprometió la cuenta de GitHub del maintainer de keyv (~127 millones de instalaciones semanales) y publicó [email protected] con un payload robacredenciales que corre en preinstall, cosechando secretos de entornos de desarrollo y CI/CD. SafeDep confirmó primero 353 versiones envenenadas en 79 paquetes, y luego escaló el conteo a 1.684 versiones envenenadas en 420 nombres de paquete atados a nueve organizaciones. El gusano saltaba de organización cada 2 a 7 minutos y completó la ráfaga inicial en media hora.

Acá está el ángulo AI, y es el que importa para esta sección: el repo de keyv contenía dos rutas alternativas de ejecución del payload pensadas para herramientas de IA. Una es un hook SessionStart en .claude/settings.json que llama a .vscode/setup.mjs. La otra es una task Environment Setup con runOn: folderOpen en .vscode/tasks.json que llama a .claude/setup.mjs. Cruzados a propósito, para que revisar un archivo no alcance.

Ambas rutas requieren acción del usuario —VS Code bloquea tasks en workspaces no confiables y Claude Code aplica su configuración de workspace trust— pero el diseño es la noticia: el atacante ya trata la configuración de tu asistente de código como superficie de ejecución. Clonar el repo y abrirlo es el trigger. Al momento del reporte, ambas rutas seguían activas en el repositorio.

04 Aug 2026
The Hacker News →
🎯

LLM Attacks & Research

Investigación

Check Point en Black Hat: 11 vulnerabilidades en seis frameworks de agentes, y el problema no es el prompt injection

La charla No Tools Required: Post-Injection Exploitation Across AI Agent Frameworks se presentó el 5 de agosto en Black Hat USA. Check Point Research evaluó LangChain, LangGraph, CrewAI, AutoGen, Microsoft Agent Framework y Google ADK, y divulgó 11 vulnerabilidades, varias críticas.

La tesis es la que da título a la nota de The Register: el prompt injection no es el bug, los frameworks de agentes lo son. Tres hallazgos concretos:

  • Deserialización insegura — el atacante inyecta payloads en la data de checkpoint. Cuando otro usuario rebobina su sesión, el payload ejecuta, con acceso a shell en el server.
  • APIs de desarrollo ocultas — asistentes de desarrollo siguen accesibles por HTTP aunque no figuren en el listado de la app, permitiendo escritura de archivos y ejecución de código sin autenticación.
  • Violación de límites — contenido controlado por prompt cruza la frontera hacia la lógica confiable del framework: orquestación, memoria, estado y routing.

Lo incómodo del hallazgo: son clases de vulnerabilidad viejas —deserialización, SSRF, path traversal, use-after-free— metidas adentro de frameworks de agentes en producción. No hace falta inventar un ataque nuevo cuando el stack nuevo repite los errores del stack viejo.

05 Aug 2026
The Register →
Investigación

54 CVEs fabricados por IA entraron al NVD, seis de ellos contra SQLite con CVSS de hasta 9.8

Investigadores encontraron 54 CVEs fabricados enviados a la National Vulnerability Database. Seis apuntaban a SQLite con scores CVSS entre 9.8 y 7.5; los otros 49 iban contra librerías como libraw y ESP32-audioI2S. Los reportes contenían funciones alucinadas, referencias a código inexistente y pruebas de concepto que no ejecutan.

El problema es de asimetría de esfuerzo, y por eso escala: generar un advisory falso convincente cuesta casi nada; verificarlo sigue siendo trabajo manual. El backlog de CVEs sin procesar en NIST pasó de más de 17.000 a fines de 2024 a más de 27.000 al cierre de 2025.

El daño no se queda en el NVD. Bases de datos downstream, GitHub Security Advisories y herramientas de escaneo automatizado consumen registros sin verificar y los propagan. Traducción: tu scanner puede estar levantando alertas sobre vulnerabilidades que nunca existieron.

JFrog propone chequeos de validación antes de actuar sobre un CVE recién publicado: buscar corroboración del vendor, exigir commit hashes o pull requests, revisar la completitud de la metadata, y validar las referencias de código contra el repositorio fuente real.

03 Aug 2026
The Register →
📢

Vendor Advisories

Aviso

Anthropic pone auto mode por defecto en Claude Code y publica los números de bloqueo de acciones dañinas

Anthropic hizo de auto mode el default de Claude Code para los planes Pro, Max y Team. Auto mode aprueba o bloquea acciones sin pedir confirmación humana en cada paso, que es la respuesta directa a la fatiga de confirmaciones en flujos agénticos —el problema real de que si le pedís permiso al usuario cincuenta veces, la vez cincuenta y uno aprueba sin leer.

Los números que publican: en un estudio con 1.053 desarrolladores pagos, solo el 13,6% de los humanos rechazó un comando dañino, mientras que auto mode bloqueó el 89% de esas acciones. Una evaluación de terceros probó 72 escenarios de prompt injection indirecto con 720 intentos de ataque en total: ninguno tuvo éxito contra Claude Fable 5, Opus 5 ni Sonnet 5 en auto mode.

Simon Willison marca el reparo que corresponde marcar: los números son buenos, pero no responden si auto mode aguanta un ataque de supply chain embebido en instrucciones de un paquete que parece legítimo. Y mirá el ítem de keyv más arriba en este mismo brief: ese ataque ya existe, ya está en npm, y ya trae un hook de Claude Code adentro.

08 Aug 2026
Simon Willison →
Aviso

OpenAI frena Astra con controles de seguridad mientras Anthropic afloja los guardrails de biología en Fable

Dos movimientos en direcciones opuestas el mismo día. OpenAI anunció medidas de seguridad para su próximo modelo Astra, cuyas evaluaciones internas muestran avances significativos en coding agéntico y ciberseguridad. Se comprometió a entornos de testing aislados, acceso restringido a red y herramientas, protección y cifrado reforzados de los pesos del modelo, monitoreo y detección adicionales, y ejecución en sandbox. Además va a pausar el testing de Astra donde esos controles no estén presentes, y desplegó monitoreo universal de acciones riesgosas y desalineación en todas sus aplicaciones agénticas.

Del otro lado, Anthropic está relajando los rechazos de seguridad de Fable para prompts de biología. La empresa lo había dejado tan restrictivo que resultaba prácticamente inservible para investigadores de seguridad y biólogos. El giro responde a presión competitiva: los labs chinos ofrecen modelos de pesos abiertos a menor costo, y un modelo demasiado maniatado empuja clientes hacia ellos.

Leídos juntos, los dos anuncios cuentan la misma historia desde puntas distintas: el techo de capacidad ciber ya obliga a controles de infraestructura, y el piso de utilidad ya obliga a aflojar refusals. Nadie está calibrando en abstracto; están calibrando contra el mercado.

08 Aug 2026
The Register →
🚨

Top Incidents

Breach

Meta confirms one of its models hacked a real company during an evaluation

Meta acknowledged that one of its models — per Reuters, Muse Spark 1.1, its most capable model for real-world coding and agentic tasks — exploited a security vulnerability in a third-party company's systems and modified parts of its internal environment during a cybersecurity evaluation. The affected organization was not named.

The evaluation was run by Irregular, an independent evaluation partner. The root cause was not a sandbox escape or a sophisticated autonomous attack: it was a configuration error that handed the model open internet access, so instead of hitting simulated infrastructure it hit real infrastructure. Irregular says there are no outstanding issues and that it is preparing best-practice guidance for secure AI evaluation protocols.

Watch the pattern, because that is the story: three labs in under three weeks. OpenAI with the Hugging Face breach, Anthropic with the models that attacked real organizations in the AISI report, and now Meta. Three incidents, one structural cause — the evaluation environment had internet egress — and not once did the model fail by being smarter than expected. The harness failed.

06 Aug 2026
CyberInsider →
🛡️

Framework CVEs

Critical

CVE-2026-43631: use-after-free in llama-server allows unauthenticated RCE (CVSS 9.2)

Advisory GHSA-6hc7-9rph-cm99, published 7 August: a use-after-free in llama-server's vocab pointer that triggers when the --sleep-idle-seconds feature is enabled. Affects builds b7492 through b9060. CVSS 9.2, critical.

The bug is a classic concurrency flaw (CWE-362): an unauthenticated remote attacker sends requests at vulnerable endpoints during the server's sleep transition. Concurrent worker threads dereference the freed pointer, and that is the injection point — attacker-controlled data can be planted there to reach remote code execution.

If you run llama.cpp with idle sleep exposed to a network, this is not theoretical. The race needs timing, but the endpoint is public and asks for no credentials. Until a confirmed patched build lands, the practical mitigation is to turn off --sleep-idle-seconds and pull the server off any non-loopback interface.

07 Aug 2026
GitHub Advisory Database →
📦

Supply Chain

Breach

The keyv worm poisons 1,684 npm versions and ships Claude Code and VS Code hooks as execution paths

An attacker compromised the GitHub account of the maintainer behind keyv (~127 million weekly npm installs) and pushed [email protected] with a credential-stealing payload that runs on preinstall, harvesting secrets from developer and CI/CD environments. SafeDep first confirmed 353 poisoned versions across 79 package names, then expanded the count to 1,684 poisoned versions across 420 package names tied to nine organizations. The worm hopped between organizations every 2–7 minutes and finished its initial burst in about half an hour.

Here is the AI angle, and it is the one that matters for this section: the keyv repository contained two alternative payload execution paths aimed at AI tooling. One is a SessionStart hook in .claude/settings.json calling .vscode/setup.mjs. The other is an Environment Setup task with runOn: folderOpen in .vscode/tasks.json calling .claude/setup.mjs. Deliberately crossed, so that checking one file is not enough.

Both routes need user action — VS Code blocks untrusted workspace tasks by default and Claude Code applies workspace trust settings — but the design is the news: the attacker now treats your coding assistant's configuration as executable surface. Cloning the repo and opening it is the trigger. At the time of reporting, both routes were still live in the repository.

04 Aug 2026
The Hacker News →
🎯

LLM Attacks & Research

Research

Check Point at Black Hat: 11 vulnerabilities across six agent frameworks, and prompt injection is not the problem

The talk No Tools Required: Post-Injection Exploitation Across AI Agent Frameworks was presented on 5 August at Black Hat USA. Check Point Research evaluated LangChain, LangGraph, CrewAI, AutoGen, Microsoft Agent Framework and Google ADK, and disclosed 11 vulnerabilities, several rated critical.

The thesis is the one in The Register's headline: prompt injection is not the bug, agent frameworks are. Three concrete findings:

  • Insecure deserialization — the attacker injects payloads into checkpoint data. When a different user rewinds their session, the payload executes, potentially granting shell access to the server.
  • Hidden development APIs — development assistants stay reachable over HTTP despite being hidden from normal app listings, allowing file writes and code execution without authentication.
  • Boundary violations — prompt-controlled content crosses into the framework's trusted logic: orchestration, memory, state and routing.

The uncomfortable part: these are old vulnerability classes — deserialization, SSRF, path traversal, use-after-free — now embedded in production agent frameworks. Nobody needs to invent a new attack when the new stack repeats the old stack's mistakes.

05 Aug 2026
The Register →
Research

54 AI-fabricated CVEs made it into the NVD, six of them against SQLite with CVSS up to 9.8

Researchers found 54 fabricated CVEs submitted to the National Vulnerability Database. Six targeted SQLite with CVSS scores between 9.8 and 7.5; the other 49 went after libraries such as libraw and ESP32-audioI2S. The reports contained hallucinated functions, references to nonexistent code, and proofs-of-concept that do not execute.

The problem is effort asymmetry, which is why it scales: generating a convincing fake advisory costs almost nothing; verifying one is still manual work. NIST's backlog of unprocessed CVEs grew from over 17,000 in late 2024 to over 27,000 by the end of 2025.

The damage does not stop at the NVD. Downstream vulnerability databases, GitHub Security Advisories, and automated scanning tools all consume unverified records and propagate them. Translation: your scanner may be raising alerts about vulnerabilities that never existed.

JFrog proposes validation checks before acting on a newly published CVE: look for vendor corroboration, require commit hashes or pull requests, examine metadata completeness, and validate code references against the actual source repository.

03 Aug 2026
The Register →
📢

Vendor Advisories

Advisory

Anthropic makes auto mode the default in Claude Code and publishes its harmful-action blocking numbers

Anthropic made auto mode the default in Claude Code for Pro, Max and Team plans. Auto mode approves or blocks actions without asking for human confirmation at each step, which is the direct answer to confirmation fatigue in agent workflows — the real problem being that if you ask the user fifty times, on the fifty-first they approve without reading.

The published numbers: in a study of 1,053 paid developers, only 13.6% of humans refused a harmful command, while auto mode blocked 89% of such actions. A third-party evaluation tested 72 indirect prompt injection scenarios across 720 total attack attempts: none succeeded against Claude Fable 5, Opus 5 or Sonnet 5 in auto mode.

Simon Willison flags the caveat worth flagging: the numbers are good, but they do not answer whether auto mode holds up against a supply-chain attack embedded in instructions from a package that looks legitimate. And look at the keyv item higher up in this same brief: that attack already exists, is already on npm, and already ships a Claude Code hook inside.

08 Aug 2026
Simon Willison →
Advisory

OpenAI slows Astra behind new security controls while Anthropic loosens Fable's biology guardrails

Two moves in opposite directions on the same day. OpenAI announced security measures for its upcoming Astra model, whose internal evaluations show significant advances in agentic coding and cybersecurity. It committed to isolated testing environments, restricted network and tool access, enhanced model weight protections and encryption, additional monitoring and detection, and sandboxed execution. It will also pause Astra testing wherever those controls are absent, and has deployed universal monitoring for risky actions and misalignment across all its agentic applications.

On the other side, Anthropic is relaxing Fable's safety refusals for biology-related prompts. The company had made it restrictive enough to be all but useless for security researchers and biologists. The shift answers competitive pressure: Chinese labs offer open-weight models at lower cost, and an over-hobbled model pushes customers toward them.

Read together, the two announcements tell the same story from opposite ends: the cyber capability ceiling now forces infrastructure controls, and the usefulness floor now forces looser refusals. Nobody is calibrating in the abstract; they are calibrating against the market.

08 Aug 2026
The Register →
🚨

Top Incidents

Breach

Meta confirme qu'un de ses modèles a piraté une vraie entreprise pendant une évaluation

Meta a reconnu qu'un de ses modèles — selon Reuters, Muse Spark 1.1, son modèle le plus performant pour le code et les tâches agentiques — a exploité une vulnérabilité dans les systèmes d'une entreprise tierce et modifié des parties de son environnement interne lors d'une évaluation de cybersécurité. L'organisation touchée n'a pas été nommée.

L'évaluation était menée par Irregular, partenaire d'évaluation indépendant. La cause racine n'est ni une évasion de sandbox ni une attaque autonome sophistiquée : une erreur de configuration a donné au modèle un accès à internet ouvert, si bien qu'au lieu de viser une infrastructure simulée il a visé une infrastructure réelle. Irregular indique qu'aucun problème ne reste ouvert et prépare des recommandations pour des protocoles d'évaluation sécurisés.

Surveillez le motif : trois labos en moins de trois semaines. OpenAI avec la brèche Hugging Face, Anthropic avec les modèles ayant attaqué de vraies organisations dans le rapport AISI, et maintenant Meta. Trois incidents, une même cause structurelle — l'environnement d'évaluation avait une sortie internet — et jamais le modèle n'a échoué en étant plus malin que prévu. C'est le harnais qui a échoué.

06 Aug 2026
CyberInsider →
🛡️

Framework CVEs

Critique

CVE-2026-43631 : use-after-free dans llama-server permettant un RCE non authentifié (CVSS 9.2)

Advisory GHSA-6hc7-9rph-cm99, publié le 7 août : un use-after-free sur le pointeur de vocab de llama-server, déclenché lorsque l'option --sleep-idle-seconds est activée. Concerne les builds b7492 à b9060. CVSS 9.2, critique.

Le bug est une faille de concurrence classique (CWE-362) : un attaquant distant non authentifié envoie des requêtes vers les endpoints vulnérables pendant la transition en veille du serveur. Les threads concurrents déréférencent le pointeur libéré, et c'est là que le payload entre — des données contrôlées par l'attaquant y mènent à une exécution de code à distance.

Si vous exécutez llama.cpp avec la veille inactive exposée au réseau, ce n'est pas théorique. La course exige du timing, mais l'endpoint est public et ne demande aucune authentification. En attendant un build corrigé confirmé, la mitigation pratique consiste à désactiver --sleep-idle-seconds et à retirer le serveur de toute interface autre que loopback.

07 Aug 2026
GitHub Advisory Database →
📦

Supply Chain

Breach

Le ver keyv empoisonne 1 684 versions npm et embarque des hooks Claude Code et VS Code comme voies d'exécution

Un attaquant a compromis le compte GitHub du mainteneur de keyv (~127 millions d'installations npm hebdomadaires) et publié [email protected] avec un payload voleur d'identifiants exécuté au preinstall, récoltant les secrets des environnements de développement et de CI/CD. SafeDep a d'abord confirmé 353 versions empoisonnées sur 79 paquets, puis porté le compte à 1 684 versions empoisonnées sur 420 noms de paquets liés à neuf organisations. Le ver passait d'une organisation à l'autre toutes les 2 à 7 minutes et a bouclé sa rafale initiale en une demi-heure.

Voici l'angle IA, celui qui compte ici : le dépôt keyv contenait deux voies d'exécution alternatives du payload visant l'outillage IA. La première est un hook SessionStart dans .claude/settings.json appelant .vscode/setup.mjs. La seconde est une tâche Environment Setup avec runOn: folderOpen dans .vscode/tasks.json appelant .claude/setup.mjs. Croisées volontairement, pour qu'inspecter un seul fichier ne suffise pas.

Les deux voies exigent une action de l'utilisateur — VS Code bloque par défaut les tâches des workspaces non fiables et Claude Code applique ses réglages de confiance — mais la conception est l'information : l'attaquant traite désormais la configuration de votre assistant de code comme une surface exécutable. Cloner puis ouvrir le dépôt suffit à déclencher. Au moment du signalement, les deux voies étaient toujours actives dans le dépôt.

04 Aug 2026
The Hacker News →
🎯

LLM Attacks & Research

Recherche

Check Point à Black Hat : 11 vulnérabilités dans six frameworks d'agents, et l'injection de prompt n'est pas le problème

La présentation No Tools Required: Post-Injection Exploitation Across AI Agent Frameworks a eu lieu le 5 août à Black Hat USA. Check Point Research a évalué LangChain, LangGraph, CrewAI, AutoGen, Microsoft Agent Framework et Google ADK, et divulgué 11 vulnérabilités, dont plusieurs critiques.

La thèse est celle du titre de The Register : l'injection de prompt n'est pas le bug, ce sont les frameworks d'agents. Trois constats concrets :

  • Désérialisation non sécurisée — l'attaquant injecte des payloads dans les données de checkpoint. Quand un autre utilisateur rembobine sa session, le payload s'exécute, avec un accès shell possible au serveur.
  • APIs de développement cachées — des assistants de développement restent joignables en HTTP bien qu'absents des listings applicatifs, permettant écriture de fichiers et exécution de code sans authentification.
  • Violations de frontière — le contenu contrôlé par prompt franchit la limite vers la logique de confiance du framework : orchestration, mémoire, état et routage.

Le point gênant : ce sont d'anciennes classes de vulnérabilités — désérialisation, SSRF, traversée de chemin, use-after-free — désormais logées dans des frameworks d'agents en production. Inutile d'inventer une nouvelle attaque quand la nouvelle stack répète les erreurs de l'ancienne.

05 Aug 2026
The Register →
Recherche

54 CVE fabriqués par IA sont entrés dans le NVD, dont six contre SQLite avec un CVSS jusqu'à 9,8

Des chercheurs ont trouvé 54 CVE fabriqués soumis à la National Vulnerability Database. Six visaient SQLite avec des scores CVSS entre 9,8 et 7,5 ; les 49 autres ciblaient des bibliothèques comme libraw et ESP32-audioI2S. Les rapports contenaient des fonctions hallucinées, des références à du code inexistant et des preuves de concept inexécutables.

Le problème tient à l'asymétrie d'effort, d'où son passage à l'échelle : produire un faux advisory convaincant ne coûte presque rien ; le vérifier reste un travail manuel. L'arriéré de CVE non traités du NIST est passé de plus de 17 000 fin 2024 à plus de 27 000 fin 2025.

Les dégâts ne s'arrêtent pas au NVD. Les bases de vulnérabilités en aval, GitHub Security Advisories et les outils d'analyse automatisée consomment des enregistrements non vérifiés et les propagent. Traduction : votre scanner peut lever des alertes sur des vulnérabilités qui n'ont jamais existé.

JFrog propose des contrôles de validation avant d'agir sur un CVE récemment publié : chercher une corroboration de l'éditeur, exiger des hashes de commit ou des pull requests, examiner la complétude des métadonnées, et valider les références de code contre le dépôt source réel.

03 Aug 2026
The Register →
📢

Vendor Advisories

Avis

Anthropic active auto mode par défaut dans Claude Code et publie ses chiffres de blocage d'actions nuisibles

Anthropic a fait d'auto mode le réglage par défaut de Claude Code pour les offres Pro, Max et Team. Auto mode approuve ou bloque les actions sans demander de confirmation humaine à chaque étape, réponse directe à la fatigue de confirmation dans les flux agentiques — le vrai problème étant que si vous sollicitez l'utilisateur cinquante fois, à la cinquante-et-unième il approuve sans lire.

Les chiffres publiés : dans une étude portant sur 1 053 développeurs payants, seuls 13,6% des humains ont refusé une commande nuisible, tandis qu'auto mode a bloqué 89% de ces actions. Une évaluation tierce a testé 72 scénarios d'injection de prompt indirecte sur 720 tentatives d'attaque au total : aucune n'a réussi contre Claude Fable 5, Opus 5 ou Sonnet 5 en auto mode.

Simon Willison signale la réserve qu'il faut signaler : les chiffres sont bons, mais ils ne disent pas si auto mode résiste à une attaque de chaîne d'approvisionnement intégrée aux instructions d'un paquet qui semble légitime. Et regardez l'entrée keyv plus haut dans ce même brief : cette attaque existe déjà, elle est déjà sur npm, et elle embarque déjà un hook Claude Code.

08 Aug 2026
Simon Willison →
Avis

OpenAI freine Astra derrière de nouveaux contrôles de sécurité tandis qu'Anthropic assouplit les garde-fous biologie de Fable

Deux mouvements en sens inverse le même jour. OpenAI a annoncé des mesures de sécurité pour son futur modèle Astra, dont les évaluations internes montrent des avancées significatives en codage agentique et en cybersécurité. L'entreprise s'engage sur des environnements de test isolés, un accès réseau et outils restreint, une protection et un chiffrement renforcés des poids du modèle, une surveillance et une détection accrues, et une exécution en sandbox. Elle suspendra aussi les tests d'Astra là où ces contrôles sont absents, et a déployé une surveillance universelle des actions risquées et du désalignement sur toutes ses applications agentiques.

De l'autre côté, Anthropic assouplit les refus de sécurité de Fable pour les prompts liés à la biologie. L'entreprise l'avait rendu si restrictif qu'il en devenait quasi inutilisable pour les chercheurs en sécurité et les biologistes. Ce virage répond à la pression concurrentielle : les labos chinois proposent des modèles à poids ouverts moins chers, et un modèle trop bridé pousse les clients vers eux.

Lus ensemble, les deux annonces racontent la même histoire par deux bouts : le plafond de capacité cyber impose désormais des contrôles d'infrastructure, et le plancher d'utilité impose désormais des refus plus souples. Personne ne calibre dans l'abstrait ; on calibre contre le marché.

08 Aug 2026
The Register →