GPT-5.5 et DeepSeek V4 : la semaine qui a tout changé
Alexandre
··
Durée de lecture : 18 min
Crédit : 9to5Mac / OpenAI
En quatre jours, de mardi à vendredi, OpenAI a sorti deux modèles majeurs, DeepSeek a répondu avec un monstre de 1,6 trillion de paramètres à un septième du prix, Anthropic a vu son modèle cybersécurité fuiter, et une startup nucléaire a levé un milliard de dollars en IPO parce que les data centers pour l'IA consomment trop d'électricité.
C'est le genre de semaine où tu scrolles tes feeds le matin et tu te demandes si t'as raté un épisode. ChatGPT Images 2 le mardi 21, la guerre verbale Altman/Anthropic jusqu'au jeudi, DeepSeek V4 et GPT-5.5 le même vendredi 24, et X-energy qui flambe à 26% le jour de son introduction en bourse. Pour moi, dev solo qui construit Livate avec Claude Code, cinq actus de cette densité dans une seule semaine, c'est rare — et chacune change quelque chose dans mon calcul.
Sources : TechCrunch, The Verge, CNBC, VentureBeat, The Guardian, Reuters, 9to5Mac
ChatGPT Images 2 : OpenAI reboot DALL-E avec de la recherche web dans le loop
Le 21 avril 2026, OpenAI a lancé ChatGPT Images 2 pour remplacer DALL-E 3. Deux modes : "Instant" pour la vitesse, "Thinking" pour les générations complexes — ce second mode peut chercher sur le web avant de générer. Résolution jusqu'à 2K, huit sorties simultanées, ratios de 1:3 à 3:1. Disponible immédiatement pour les abonnés Plus, Pro, Business et Enterprise.
Cliquer pour agrandir
Crédit : 9to5Mac / OpenAI
La fonctionnalité qui change vraiment la donne, c'est le mode "Thinking". Avant de générer, le modèle peut faire une recherche web pour récupérer des informations actuelles — logos récents d'une entreprise, couleurs d'une campagne en cours, visuels d'un événement. The Verge note que c'est la première fois qu'un générateur d'images natif peut aller chercher de l'information fraîche avant de produire.
Définition — Génération avec reasoning visuel : capacité d'un modèle à combiner une étape de recherche ou de raisonnement textuel avec la génération d'image, permettant de produire des visuels contextuellement précis plutôt que de se baser uniquement sur les données d'entraînement. ChatGPT Images 2 est le premier modèle grand public à proposer ce pipeline nativement.
L'amélioration du rendu du texte dans les images est réelle. ChatGPT Images 2 gère maintenant les scripts non-latins — japonais, coréen, hindi, bengali — avec un taux d'erreur typographique significativement réduit. Pour les designs de magazines, les slides ou les visuels marketing, c'est le point douloureux historique des générateurs. USA Today a testé le rendu sur des compositions denses : les doigts supplémentaires ont quasi disparu, les textes en incrustation sont lisibles.
Sur Reddit (r/MachineLearning, r/artificial), les retours ont été tranchés : le mode "Thinking" est lent — plusieurs dizaines de secondes — mais les résultats sur les prompts complexes sont nettement au-dessus du modèle précédent. Le ratio 3:1 pour les visuels ultra-larges (bannières, headers) a été particulièrement noté.
Fonctionnalité
ChatGPT Images 2
DALL-E 3 (précédent)
Résolution max
2K
1024×1024
Sorties simultanées
8
4
Recherche web avant génération
Oui (mode Thinking)
Non
Ratios disponibles
1:3 à 3:1
1:1, 16:9, 9:16
Scripts non-latins
Amélioré significativement
Erreurs fréquentes
Source : The Verge, 9to5Mac, OpenAI, 21 avril 2026
Mon take de dev solo
Je génère des visuels pour Livate régulièrement — captures d'écran améliorées, illustrations pour l'App Store, images d'articles. Le mode "Instant" me suffit pour 90% des cas. Ce qui m'intéresse vraiment dans "Thinking", c'est l'accès aux données fraîches : si je dois générer un visuel qui inclut l'état actuel d'une interface ou d'un design system connu, ne pas être limité aux données d'entraînement est un vrai gain.
La résolution 2K change aussi quelque chose de concret pour les visuels App Store. Les captures promotionnelles Apple demandent du 1290×2796 pour les iPhone 16 Pro — être proche de ce format en génération native économise une étape de post-processing.
Ce qui me laisse plus sceptique : le mode "Thinking" à plusieurs dizaines de secondes dans un workflow de production, c'est frustrant. Je préfère une interface rapide avec 4 résultats immédiats plutôt qu'une attente longue pour un résultat "parfait" que je devrai quand même retoucher.
Cliquer pour agrandir
Crédit : The Guardian
Anthropic Mythos, accès non autorisé, et Sam Altman qui sort le couteau
Anthropic a limité Mythos, son modèle cybersécurité, à un cercle restreint : NVIDIA, Amazon, Apple et JPMorgan Chase côté entreprises US. La raison officielle : risques de "cyber-weaponisation". Sam Altman a répondu via X le 21 avril en qualifiant la communication d'Anthropic de "fear-based marketing". Cette semaine, SecurityWeek révèle des incidents d'accès non autorisés au modèle.
J'avais couvert le lancement de Mythos en détail dans mon article sur Claude Mythos et les failles zero-day. La semaine dernière, c'était le mémo à la Maison Blanche qui faisait parler. Cette semaine, c'est deux nouvelles couches qui s'ajoutent.
La première : The Guardian a publié un long article sur pourquoi Mythos pose un problème d'une autre nature que les autres modèles. Mythos ne fait pas que détecter des vulnérabilités — il peut en générer. Anthropic l'a conçu pour simuler des attaquants sophistiqués. La distinction entre "outil défensif pour audits internes" et "accélérateur d'offensives cyberterroristes" tient à qui a accès et dans quelles conditions. Restreindre à quatre entreprises, c'est l'argument de sécurité. Mais ces quatre entreprises gèrent des infrastructures critiques, des données financières et des supply chains matérielles. La surface d'attaque potentielle n'est pas nulle.
La seconde couche : SecurityWeek signale dans un billet "In Other News" cette semaine des incidents d'"accès non autorisé à Mythos". Les détails sont maigres, mais le timing — pendant que le Department of State publie une alerte mondiale sur les vols de données IA par des acteurs chinois — ne passe pas inaperçu.
Définition — Modèle IA à double usage (dual-use) : modèle dont les capacités peuvent être utilisées à des fins défensives (audit de sécurité, détection de vulnérabilités) autant qu'offensives (génération d'exploits, automatisation d'attaques). Le problème du double usage est structurel : les mêmes capacités qui permettent de trouver une faille de sécurité permettent théoriquement de l'exploiter.
La réplique de Sam Altman — "fear-based marketing" — est intéressante à décoder. TechCrunch rapporte qu'Altman a posté cette phrase sans développement. C'est une attaque de positionnement, pas un argument technique. Anthropic construit une identité autour de la sécurité comme valeur différenciante. OpenAI construit autour de la vitesse et de l'accessibilité. Les deux sont cohérents avec leur modèle business. Mais quand des incidents d'accès non autorisés surviennent sur le modèle "trop dangereux pour le public", l'argument de sécurité d'Anthropic prend un coup.
Mon take de dev solo qui utilise Claude Code tous les jours
Ce débat me concerne en premier lieu, pas comme cible de cyberattaques, mais comme utilisateur d'Anthropic. La tension entre "nous mettons la sécurité au centre" et les incidents de cette semaine soulève une question pratique : est-ce qu'Anthropic peut tenir les deux postures en même temps sur la durée ?
Pour l'instant, mes outils quotidiens — Claude Code, Claude Opus — ne sont pas impactés. Mais comment j'utilise Claude Code pour développer Livate repose sur une confiance dans la direction de l'entreprise. Si les incidents autour de Mythos deviennent un pattern, ça rentre dans ma réflexion sur la diversification des outils.
Ce qui me frappe dans le clash Altman/Anthropic, c'est qu'il révèle deux philosophies incompatibles sur ce que l'IA doit être. Pas deux variantes d'une même vision — deux visions fondamentalement différentes. Et les deux sont sincères. Ce n'est pas confortable.
DeepSeek V4 : 1,6 trillion de paramètres à un septième du prix de GPT-5.5
Le 24 avril 2026, DeepSeek — la startup de Hangzhou — a lancé deux variantes de son V4 en preview open-source : V4-Pro avec 1,6 trillion de paramètres, et V4-Flash avec 284 milliards. Prix API V4-Pro : $1,74 par million de tokens en entrée, $3,48 en sortie. Soit environ un septième du coût de GPT-5.5. V4-Pro tourne sur les puces Ascend 950 de Huawei — première fois qu'un modèle frontier fonctionne sans GPU NVIDIA à cette échelle.
Cliquer pour agrandir
Crédit : Intelligent Living / DeepSeek
Le 1,6 trillion de paramètres, c'est le chiffre qui fait le tour de X et Reddit depuis vendredi. Pour contexte : GPT-4 tourne autour de 1,8 trillion selon les estimations — DeepSeek V4-Pro est dans le même ordre de grandeur. CNBC et TechCrunch s'accordent sur le positionnement benchmark : V4-Pro dépasse GPT-5.2 et Gemini 3.0 Pro sur les tâches de raisonnement logique, et atteint GPT-5.4 sur les compétitions de programmation.
Modèle
Paramètres
Prix input ($/M tokens)
Prix output ($/M tokens)
DeepSeek V4-Pro
1,6T
$1,74
$3,48
DeepSeek V4-Flash
284B
$0,14
$0,28
GPT-5.5
N/A
$5,00
$30,00
Claude Opus 4.7
N/A
~$15,00
~$75,00
Sources : VentureBeat, Gizmodo, MLQ.ai, 24 avril 2026
VentureBeat pointe le ratio le plus parlant : avec les tokens en cache, V4-Pro coûte environ un dixième de GPT-5.5. Pour les use cases avec beaucoup de contexte répété — agents de code qui relisent les mêmes fichiers en boucle, par exemple — c'est un écart de coût qui se creuse vraiment sur les gros volumes.
Le choix de Huawei Ascend 950 n'est pas un détail d'infrastructure. CNBC rapporte ce vendredi que le State Department américain a envoyé une alerte diplomatique mondiale sur les risques de vol de données IA par des acteurs chinois, mentionnant DeepSeek explicitement. Huawei qui "vow full support" pour V4 (South China Morning Post) en fournissant les puces, pendant que Washington alerte ses ambassades sur les risques de distillation — la géopolitique et la roadmap technique sont maintenant inséparables.
Définition — Architecture MoE (Mixture of Experts) : technique d'architecture de LLM où le réseau est divisé en sous-réseaux spécialisés (experts). À chaque inférence, seul un sous-ensemble d'experts est activé, ce qui permet d'augmenter le nombre total de paramètres sans augmenter proportionnellement la compute nécessaire. DeepSeek utilise cette approche pour atteindre 1,6T de paramètres à des coûts d'inférence raisonnables.
Mon take de dev solo
Le V4-Flash à $0,14 par million de tokens en entrée, c'est le plus petit prix du tableau ci-dessus. Pour des tâches simples — classification, extraction, génération de texte court — c'est difficile à ignorer. Je teste sur Livate des pipelines de génération de contenu à faible coût : à ce tarif, un million de requêtes courtes revient à 140 dollars.
Ce que je surveille : la latence en conditions réelles. Les benchmarks sur les tâches de programmation sont encourageants, mais l'architecture des agents de code que j'utilise avec Claude Code repose sur des allers-retours rapides entre appels. Un modèle moins cher mais plus lent ne me fait pas économiser de temps.
Sur l'aspect géopolitique : je fais tourner mes outils de production sur Claude Code. Je ne vais pas déployer un modèle DeepSeek en production aujourd'hui avec une alerte diplomatique du State Department qui tourne. Pas pour des raisons idéologiques — pour des raisons de risque réglementaire. L'alerte d'aujourd'hui peut devenir une interdiction dans six mois.
GPT-5.5 : OpenAI sort son modèle le plus avancé le même jour que DeepSeek V4
GPT-5.5 a été lancé le 24 avril 2026 — le même jour que DeepSeek V4. OpenAI annonce 82,7% sur SWE-bench, une fenêtre de contexte d'un million de tokens, des capacités améliorées en coding agentique, computer use et recherche scientifique. Prix : $5 par million de tokens en entrée, $30 en sortie. Disponible pour ChatGPT Plus, Pro, Business et Enterprise via l'interface et l'API.
Le timing du lancement conjoint GPT-5.5 / DeepSeek V4 le même vendredi 24 n'est probablement pas un accident du côté d'OpenAI. CNET titre "AI Arms Race Accelerates" sur la journée du 24 : trois labs majeurs (OpenAI, DeepSeek, Anthropic avec ses propres mises à jour) dans la même fenêtre de 24h, c'est une pression concurrentielle qui s'exprime ouvertement.
Le score de 82,7% sur SWE-bench est le chiffre le plus cité. SWE-bench mesure la capacité à résoudre de vrais tickets GitHub — pas des exercices artificiels de coding, des problèmes réels extraits de repositories open-source. Pour contexte : Opus 4.7 avait atteint 64,3% il y a une semaine (j'en avais parlé dans l'actu du 19 avril), GPT-5.4 était à 57,7%. GPT-5.5 à 82,7%, c'est un saut qui redessine le leaderboard.
Définition — SWE-bench : benchmark créé par des chercheurs de Princeton, devenu la référence pour évaluer les capacités de coding des LLMs. Il extrait 2 294 paires (problème, solution) de 12 repositories GitHub populaires, et mesure si le modèle peut écrire le patch correct pour résoudre le problème réel. Un score de 82,7% signifie que GPT-5.5 résout correctement 82,7% des tickets, en conditions proches d'un agent de code réel.
La fenêtre de contexte d'un million de tokens change vraiment les choses sur de vrais projets. Pour un projet comme Livate avec des dizaines de fichiers Swift, un million de tokens signifie potentiellement tout le projet dans le contexte en une seule session — sans le découpage manuel que j'utilise actuellement avec Claude Code. MLQ.ai décrit un modèle conçu pour "des interactions moins guidées" — moins besoin de spécifier exactement chaque étape, plus d'autonomie dans le raisonnement sur des tâches longues.
Sur le pricing : $5/$30 par million de tokens (entrée/sortie). Cher. Comparé aux $1,74/$3,48 de DeepSeek V4-Pro, le ratio est de 1 contre 3 à 8 selon les cas d'usage. OpenAI parie que la qualité absolue justifie la prime. Pour les use cases enterprise à fort enjeu — debugging de production critique, génération de code de sécurité — probablement oui. Pour la génération quotidienne dans un workflow solo, c'est moins évident.
Modèle
SWE-bench score
Contexte
Prix input
Date
GPT-5.5
82,7%
1M tokens
$5/M
24 avr. 2026
Claude Opus 4.7
64,3%
200K tokens
~$15/M
16 avr. 2026
GPT-5.4
57,7%
128K tokens
N/A
Mars 2026
Sources : MLQ.ai, VentureBeat, 24-25 avril 2026
Mon take de dev solo qui suit le leaderboard SWE-bench de semaine en semaine
82,7% sur SWE-bench, c'est une rupture. Pas une amélioration incrémentale — le delta de 18 points en une semaine (de Opus 4.7 à GPT-5.5) est le plus grand saut que j'aie observé depuis GPT-4. Si ce score se confirme en conditions réelles — pas juste sur le benchmark, mais sur des codebases Swift avec des contraintes iOS spécifiques — c'est le modèle de coding le plus utile disponible aujourd'hui.
Le million de tokens de contexte est le paramètre qui changerait le plus ma façon de travailler. Mon setup actuel avec Claude Code implique des CLAUDE.md de contexte, des découpes de sessions, des rappels de state. Avec 1M tokens, la plupart de ces frictions disparaissent.
Ce qui me retient de switcher immédiatement : le pricing de sortie. $30 par million de tokens en sortie, sur des sessions de coding longues où le modèle génère beaucoup de texte et de code, la note mensuelle peut grimper vite. Je suis à 100€/mois sur Claude Code. GPT-5.5 au prix API, sur mon volume, je dois calculer avant de me réjouir.
X-energy : un milliard de dollars en IPO pour alimenter les data centers de l'IA
X-energy, startup de réacteurs nucléaires modulaires (SMR) de 80 MW, a levé 1 milliard de dollars dans son IPO le 24 avril 2026 — au-dessus de ses propres estimations. 44,3 millions d'actions vendues à $23, soit une prime de 44% sur le prix cible initial de $16-19. Valorisation en premier jour : 11,9 milliards de dollars. Amazon, Jane Street, ARK Invest et Ares Management participent.
Cliquer pour agrandir
Crédit : Reuters / Economic Times
Cette actu semble distante du reste de la semaine, mais c'est en fait le même sujet. GPT-5.5 et DeepSeek V4 ne font pas que traiter plus de tokens — ils consomment plus d'électricité. L'entraînement d'un LLM de 1,6T paramètres, le serving de milliers de requêtes simultanées avec des fenêtres de contexte d'un million de tokens : c'est une consommation électrique à l'échelle nationale.
TechCrunch pointe sans ambiguïté que la demande des data centers a "transformé l'appétit des investisseurs pour le nucléaire avancé". X-energy développe des réacteurs Xe-100 de 80 MW à haute température (HTGR). L'argument, c'est la compacité : des unités déployables proches des data centers, sans les contraintes de site d'une centrale nucléaire classique.
Reuters note que X-energy a déjà levé plus de 1,4 milliard avant son IPO — dont un round Series D de 700 millions en novembre — avec Amazon et le Climate Pledge Fund parmi les investisseurs. Amazon qui investit dans X-energy n'est pas un acte philanthropique. C'est une stratégie d'approvisionnement en énergie carbone-free pour ses data centers AWS.
Étape
Date
Montant
Valorisation
Series D
Nov. 2025
$700M
N/A
Fixation prix IPO
23 avr. 2026
—
~$9B
IPO Nasdaq (XE)
24 avr. 2026
$1B
$11,9B
Premier jour +26%
24 avr. 2026
—
$15B+
Sources : TechCrunch, Reuters, Business Wire, 23-24 avril 2026
CNBC détaille que le cours a gagné 26% le premier jour. Pour une IPO de startup nucléaire — un secteur historiquement boudé des marchés à cause des délais de déploiement de 10-15 ans — ça montre que les marchés pensent enfin à plus long terme sur l'énergie.
Définition — SMR (Small Modular Reactor) : réacteur nucléaire dont la puissance est inférieure à 300 MW électriques, conçu pour être fabriqué en usine et déployé modulairement. Contrairement aux centrales traditionnelles de 1000+ MW qui demandent des chantiers de plusieurs décennies, les SMR visent des délais de déploiement de 3-5 ans après approbation réglementaire. X-energy développe le Xe-100, un réacteur de 80 MW à haute température, refroidi au gaz.
Mon take de dev solo
Je construis Livate pour aider les gens à passer à l'action sur leurs objectifs. Mais la réalité que cette actu illustre, c'est que chaque fois que j'utilise Claude Code pour générer du code, je consomme de l'électricité quelque part dans un data center. L'abstraction du "cloud" efface cette réalité physique.
X-energy à 11,9 milliards de valorisation le jour de son IPO dit que les marchés financiers ont intégré que l'IA va nécessiter une infrastructure énergétique que le solaire et l'éolien seuls ne peuvent pas couvrir à l'échelle et avec la densité requise. Ce n'est pas un débat idéologique — c'est une contrainte physique de densité énergétique.
Ce qui me frappe dans cette IPO : Amazon est dedans. Pas comme client potentiel futur — comme investisseur depuis plusieurs rounds. Les hyperscalers ne financent pas des startups nucléaires par caprice ESG. Ils financent leur propre infrastructure de demain.
Premier accès direct à une détection deepfake institutionnelle pour des non-techniciens
OpenAI ads dans ChatGPT
OpenAI a lancé des publicités click-based dans l'interface ChatGPT — Ad Age couvre le débat. Forte réaction négative sur Reddit r/ChatGPT.
Début de la monétisation publicitaire de ChatGPT : les abonnés payants vont voir des pubs
US State Dept alerte DeepSeek
Le Département d'État américain a envoyé une alerte diplomatique mondiale sur les risques de vol de données IA par DeepSeek et d'autres acteurs chinois, selon CNBC.
Contexte réglementaire qui peut changer rapidement pour les outils IA chinois en production
Huawei + DeepSeek V4
Huawei a annoncé un "support total" pour DeepSeek V4 via ses puces Ascend 950, rompant la dépendance à NVIDIA à l'échelle.
Première chaîne AI frontier complète sans matériel US — les sanctions hardware ne fonctionnent plus
Google I/O 2026 tease
Google confirme son Android Show pré-I/O avec des allusions à "Project Aluminium" — la nouvelle roadmap Android. I/O le 19 mai.
Annonces majeures Android + Gemini attendues dans 3 semaines
Ce que la semaine du 25 avril 2026 change pour les développeurs indépendants
GPT-5.5 à 82,7% SWE-bench redéfinit le standard
Le delta de 18 points en une semaine est trop grand pour l'ignorer. Si GPT-5.5 tient ce niveau en conditions réelles — pas juste sur benchmark — le marché des outils de coding va se recalibrer autour de ce score. Les modèles à 64% vont paraître vieux en quelques mois.
Le million de tokens de contexte change l'ergonomie du dev solo
Gérer un codebase de taille réelle dans une seule fenêtre de contexte sans découpes manuelles : c'est le gain opérationnel le plus concret de GPT-5.5. Ça ne remplace pas la compréhension architecturale, mais ça réduit la friction de setup à chaque session.
DeepSeek V4-Flash à $0,14/M tokens crée une nouvelle catégorie de coût
Pour les tâches simples — classification, extraction, génération courte — DeepSeek V4-Flash est difficile à ignorer rien qu'avec ces chiffres. La question réglementaire (alerte State Dept), c'est ce qui retient d'y aller en production.
L'énergie est devenue une contrainte technique réelle pour l'IA
X-energy à 11,9 milliards le jour de son IPO confirme que les marchés ont intégré l'IA comme un vrai problème d'énergie. Pour les devs qui construisent des produits IA, la facture compute va rester élevée parce que l'infrastructure coûte cher à financer.
La guerre verbale Altman/Anthropic révèle deux visions incompatibles
"Fear-based marketing" versus "nous mettons les risques sur la table" : ce n'est pas une querelle de com. Ce sont deux philosophies de déploiement qui vont produire des outils différents avec des comportements différents. Choisir ses outils, c'est aussi choisir une vision.
FAQ
GPT-5.5 remplace-t-il Claude Opus 4.7 pour le coding ?
Sur le seul critère SWE-bench, GPT-5.5 (82,7%) dépasse Opus 4.7 (64,3%) de façon significative. Mais SWE-bench mesure la résolution de tickets GitHub génériques — pas la compréhension architecturale de codebases propriétaires avec des conventions spécifiques. En pratique, le "meilleur" modèle dépend de ton codebase. La fenêtre de contexte d'1M tokens de GPT-5.5 est un vrai avantage sur les grands projets. Le pricing de sortie à $30/M est un frein pour les workflows à fort volume de génération.
DeepSeek V4-Pro est-il utilisable en production en France en mai 2026 ?
Sur le plan technique, oui — les API sont disponibles et les benchmarks sont solides. Sur le plan du risque réglementaire, la situation est moins claire : l'alerte diplomatique du State Department américain du 25 avril sur DeepSeek et les vols de données IA chinoises n'est pas une interdiction, mais c'est un marqueur de tension géopolitique qui peut évoluer. Pour des données sensibles (utilisateurs, paiements), la prudence s'impose. Pour des tâches purement génératives sans données personnelles, le risque immédiat est plus limité.
C'est quoi exactement le mode "Thinking" de ChatGPT Images 2 ?
ChatGPT Images 2 propose deux modes de génération. "Instant" génère sans délai à partir du prompt, en quelques secondes — comportement similaire à DALL-E 3. "Thinking" ajoute une étape de raisonnement avant la génération : le modèle peut faire des recherches web, analyser le contexte, et planifier sa réponse visuelle avant de générer. Résultat : latence plus élevée (dizaines de secondes), mais des compositions plus précises sur des sujets nécessitant des données fraîches ou une compréhension fine du contexte.
Pourquoi Amazon investit-il dans X-energy, une startup nucléaire ?
Amazon, via son Climate Pledge Fund, a investi dans X-energy sur plusieurs rounds avant l'IPO. La motivation est étroitement liée à AWS : les data centers AWS consomment une électricité croissante à mesure que les workloads IA augmentent. Les SMR (Small Modular Reactors) permettent de déployer de l'énergie nucléaire carbone-free à proximité des data centers, avec des délais plus courts que les centrales conventionnelles. Amazon ne finance pas l'énergie verte par idéalisme — il finance son infrastructure de computing de demain.
L'accès non autorisé à Mythos, c'est grave ?
SecurityWeek a mentionné des "incidents d'accès non autorisés à Mythos" dans sa rubrique "In Other News" cette semaine. Les détails sont rares. Ce qui rend cela préoccupant, c'est la nature du modèle : Mythos est conçu pour simuler des attaquants sophistiqués et trouver des vulnérabilités zero-day. Un accès non autorisé à un modèle avec ces capacités n'a pas les mêmes implications qu'un accès non autorisé à un générateur d'images. Anthropic n'a pas commenté publiquement les incidents à la date de publication.
La semaine qui vient sera centrée sur Google I/O 2026 le 19 mai — mais avant ça, l'Android Show de Google et les premières réponses sur Project Aluminium. Et forcément, les retours terrain sur GPT-5.5 : les benchmarks sont une chose, les codebases réels en sont une autre.
Alex
À retenir
GPT-5.5 atteint 82,7% sur SWE-bench le 24 avril — le plus grand saut de performance de coding observé en une semaine
DeepSeek V4-Pro à $1,74/M tokens = un septième du prix de GPT-5.5, avec des benchmarks proches
ChatGPT Images 2 introduit un mode "Thinking" avec recherche web avant génération — premier générateur d'images à le faire
X-energy lève 1 Md$ en IPO nucléaire le même jour, valorisée 11,9 Md$ — la demande des data centers IA transforme l'énergie
Anthropic Mythos : accès non autorisé révélé, Altman vs Anthropic, la guerre des philosophies de déploiement est ouverte