Veille IA — semaine du 24 août 2026

Sagentis · veille hebdomadaire pour les dirigeants de PME suisses · période couverte : 17 – 24 août 2026

Semaine sans rupture technique. L'essentiel se joue ailleurs : le panel de mesure indépendant s'élargit, l'écart de prix à performance équivalente atteint un facteur inédit dans nos relevés, et un éditeur ralentit publiquement le développement d'un modèle pour raison de sécurité informatique. Trois faits vérifiables qui ont plus de conséquences pratiques qu'une annonce de modèle.

Ce qui a changé cette semaine

  1. Le panel de mesure s'élargit : 82 → 86 modèles, 5 → 7 modèles à 95 % ou plus nouveau. Au relevé Vals AI du 19 août sur SWE-bench Verified, quatre modèles supplémentaires ont été évalués depuis le relevé du 12 août, et le nombre de modèles franchissant 95 % passe de cinq à sept. L'écart entre le meilleur modèle à poids ouverts et le meilleur modèle propriétaire reste à 0,60 point (97,00 % contre 96,40 %), identique à la semaine passée. Pourquoi ça compte : la fenêtre où héberger un modèle ouvert coûtait plusieurs points de performance ne s'est pas rouverte.
  2. Prix : un facteur 300 à score de préférence strictement identique nouveau. Deux modèles notés 1419 points Elo chez Metatext sont facturés 30,00 $ et 0,10 $ le million de tokens en sortie. La semaine passée, le plus grand écart que nous documentions à score égal était d'un facteur 15 (à 1463 points). Le rapport prix/performance n'est pas un réglage fin : c'est le premier poste d'économie d'un projet IA.
  3. Préférence humaine : stable, quatrième relevé consécutif. Le classement Metatext (192 modèles, relevé d'août) est inchangé : Claude Opus 4.6 (Fast) à 1500, écart premier–dixième toujours à 32 points Elo. Rien à en tirer de neuf cette semaine ; nous ne réécrivons pas le commentaire.
  4. Sûreté : un éditeur ralentit publiquement un modèle pour risque cyber nouveau. OpenAI indique avoir suspendu une partie de ses entraînements sur son modèle Astra, ne pouvant exclure qu'il atteigne le seuil « critique » de capacités cyber de son propre cadre interne, et chiffre à environ 20 % du calcul supervisé le surcoût de la supervision mise en place. C'est la première fois qu'un éditeur documente le coût opérationnel d'une mesure de sûreté.
  5. Suisse : stable au niveau fédéral, mais une lacune de mesure documentée nouveau. Aucune décision nouvelle depuis la séance du Conseil fédéral du 12 août (sommet de Genève 2027). En revanche, Le Temps documente que la Suisse ne sait pas mesurer précisément la demande électrique de ses centres de données. Pour une PME, cela signifie que les projections publiques 2030 doivent être lues comme des ordres de grandeur, pas comme des prévisions.

2. Benchmarks des modèles

Deux mesures indépendantes structurent cette section : Vals AI pour SWE-bench Verified (tâches de génie logiciel réelles, 500 cas, harnais minimal limité à l'outil bash), et Metatext pour le classement de préférence humaine LMArena. Ces deux classements ne décrivent pas la même chose et ne doivent pas être additionnés.

Préférence humaine (Elo) — stable

Le relevé Metatext d'août 2026 porte sur 192 modèles et n'a pas bougé depuis quatre relevés. Claude Opus 4.6 (Fast) reste premier à 1500 points ; l'écart entre le premier et le dixième reste de 32 points. À cette échelle, 32 points séparent des modèles que la plupart des usages de bureau ne distingueront pas.

Classement de préférence humaine LMArena — dix premiers

Source : Metatext — LMArena Elo, relevé d'août 2026, 192 modèles classés. Valeurs mesurées, inchangées depuis quatre relevés. Le score Elo mesure une préférence conversationnelle exprimée par des votes à l'aveugle ; il ne mesure ni la fiabilité ni la performance sur tâche outillée.

Écart entre modèles ouverts et propriétaires

Sur SWE-bench Verified au relevé du 19 août, Claude Opus 5 reste en tête à 97,00 % et DeepSeek V4 Pro 0813, dont les poids sont téléchargeables, reste deuxième à 96,40 %. L'écart ouvert / propriétaire est donc de 0,60 point, inchangé par rapport à la semaine passée (il était de 3,6 points deux semaines plus tôt). Kimi K3, également à poids ouverts, à 93,40 %, reste devant des modèles propriétaires comme Claude Opus 4.8 (88,60 %) et Grok 4.5 (86,60 %).

Ce que cela implique pour une PME. Sur cette tâche précise — résoudre un ticket logiciel réel avec un outil unique — le fait d'héberger le modèle chez soi ne coûte plus de performance mesurable. Cela ne dit rien du coût total : l'hébergement d'un modèle de cette taille suppose une infrastructure GPU que la très grande majorité des PME suisses n'a pas et n'a pas intérêt à acquérir. La conclusion pratique est autre : la menace crédible de passer à un modèle ouvert change la position de négociation face à un fournisseur, et rend l'enfermement propriétaire plus coûteux à imposer.

SWE-bench Verified — taux de résolution, modèles à poids ouverts distingués

Source : Vals AI — SWE-bench Verified, relevé du 19 août 2026. Valeurs mesurées. Barres encre : modèles à poids ouverts (identifiés comme tels par la source) ; barres teal : modèles propriétaires. Nous ne reportons que les scores globaux explicitement chiffrés par la source à cette date ; quatre modèles entrés cette semaine dans les dix premiers (Grok 4.6, GPT-5.6 Terra, GLM 5.3, DeepSeek V4 Flash 0731) ne sont pas chiffrés au global par la source et ne figurent donc pas ici.

Ventilation par difficulté — et un avertissement d'effectif

Le tableau de Vals AI décompose le taux de résolution par durée estimée de la tâche. Cette semaine, une quatrième bande apparaît dans la restitution publique : les tâches de plus de quatre heures — au nombre de trois. Trois tâches ne permettent aucune conclusion : passer de 67 % à 100 % sur cette bande, c'est résoudre une tâche de plus. Nous la représentons pour ne rien masquer, en déconseillant explicitement de l'interpréter. La bande utile reste celle de 15 minutes à 1 heure (261 tâches), que la source elle-même désigne comme la plus discriminante.

Taux de résolution par bande de difficulté (effectifs entre parenthèses)

Source : Vals AI — SWE-bench Verified, relevé du 19 août 2026. Valeurs mesurées, arrondies à l'entier par la source. Réserve : la bande « plus de 4 h » ne compte que 3 tâches ; les écarts qu'on y observe ne sont pas interprétables.

Élargissement du panel

Quatre modèles de plus qu'au relevé précédent ont été évalués (86 contre 82). Apparaissent notamment au classement, sans score global chiffré publiquement à ce stade : Grok 4.6, GPT-5.6 Terra, GLM 5.3, Gemini 3.7 Flash, Qwen 3.8 Max et Qwen 3.8 27B, Muse Spark 1.2, Claude Sonnet 5, Kimi K2.7 Code. Le rythme de sortie dépasse désormais la capacité d'évaluation indépendante : c'est en soi une information pour un acheteur, qui devra choisir sans mesure tierce sur les modèles les plus récents.

Valeurs relevées cette semaine — archive pour série future

IndicateurValeurSource et date du relevé
Meilleur score SWE-bench Verified97,00 % (Claude Opus 5)Vals AI, 19.08.2026
Meilleur modèle à poids ouverts96,40 % (DeepSeek V4 Pro 0813)Vals AI, 19.08.2026
Écart ouvert / propriétaire0,60 point (inchangé)Vals AI, 19.08.2026
Modèles au panel / à ≥ 95 %86 / 7Vals AI, 19.08.2026
Premier Elo LMArena1500 (Claude Opus 4.6 Fast)Metatext, août 2026
Écart Elo 1er – 10e32 points (inchangé)Metatext, août 2026
Écart de prix maximal à Elo identiquefacteur 300 (à 1419 points)Metatext, août 2026
Centres de données suisses2,1 TWh (2024), 3,6 % du courantOFEN / SuisseEnergie, 07.05.2026

3. Prix du token

La tendance de fond reste celle mesurée par Epoch AI : à niveau de performance constant, le prix de l'inférence baisse fortement d'année en année. Mais cette moyenne masque l'information utile à l'achat, qui est la dispersion à performance comparable.

Le fait de la semaine : un facteur 300 à score identique

Chez le même agrégateur, à la même date, trois paires de modèles portent exactement le même score Elo et des tarifs sans commune mesure :

Trois précautions, toutes importantes. Premièrement, ces tarifs sont des prix de sortie (le prix d'entrée, généralement plus bas, n'est pas celui représenté ici) ; Metatext qualifie explicitement ses tarifs d'indicatifs et recommande de les confirmer auprès du fournisseur avant tout usage en production. Deuxièmement, ces prix proviennent de revendeurs différents pour un même modèle : une partie de l'écart tient au canal de distribution, pas au modèle. Troisièmement et surtout : un score Elo identique ne signifie pas une aptitude identique. L'Elo mesure une préférence conversationnelle exprimée par des votes humains ; il ne prédit ni la performance sur une tâche longue et outillée, ni la sûreté — la section 6 en donne cette semaine une démonstration chiffrée dans le domaine clinique.

Ce qu'un dirigeant peut en faire. Aucun de ces chiffres ne dit « prenez le moins cher ». Ils disent qu'un écart d'un facteur 10 à 300 sur une ligne budgétaire mérite un test comparatif de deux jours sur vos propres documents avant de signer. C'est la seule manière de savoir si l'écart de prix correspond à un écart d'utilité dans votre cas.

Prix de sortie par million de tokens (score Elo rappelé dans le libellé)

Source : Metatext — LMArena Elo et tarifs, relevé d'août 2026. Prix de sortie uniquement, en dollars par million de tokens ; échelle logarithmique, les écarts allant d'un facteur cent. Réserve : Metatext signale ses tarifs comme indicatifs. Valeurs relevées, non estimées.

Dispersion à score Elo strictement identique nouveau

Source : Metatext, relevé d'août 2026. Chaque groupe réunit deux modèles portant le même score Elo au même relevé. Échelle logarithmique. Valeurs relevées ; tarifs qualifiés d'indicatifs par la source. Lecture : à préférence humaine égale, le prix ne l'est pas.

4. Suisse

Régulation fédérale — stable

Aucune décision nouvelle depuis notre édition précédente. Le cadre reste celui-ci : le Conseil fédéral a chargé le DFJP d'élaborer un projet de loi mis en consultation d'ici fin 2026, portant notamment sur la transparence, la protection des données, la non-discrimination et la surveillance ; le DETEC doit présenter un plan de mise en œuvre pour les mesures non contraignantes dans le même délai. Les deux échéances tombent dans les quatre prochains mois : c'est le calendrier qu'une PME doit avoir en tête, sans anticiper le contenu du texte, qui n'est pas public.

Rappel de la séance du 12 août, couverte la semaine passée : orientation stratégique du Geneva AI Summit 2027 arrêtée, Fabiola Gianotti nommée déléguée. Rien de neuf depuis.

Sources : Office fédéral de la justice — intelligence artificielle, SEFRI — Geneva AI Summit 2027.

Administration fédérale — le point de contact a changé de main

Élément de cadrage que nous n'avions pas donné et qui éclaire à qui s'adresser : depuis le 1er février 2026, le point de contact du Réseau de compétences en intelligence artificielle (CNAI) n'est plus rattaché à l'Office fédéral de la statistique mais à la Chancellerie fédérale, en vertu d'une modification de l'ordonnance sur la numérisation décidée le 12 décembre 2025. La décision de financement du plan de mise en œuvre de la stratégie IA de l'administration était attendue au printemps 2026 ; nous n'avons pas trouvé de communiqué en confirmant l'issue, et ne concluons donc rien sur ce point.

Source : Conseil fédéral, communiqué du 12 décembre 2025.

FINMA — stable

Pas de publication nouvelle sur l'IA cette période. Les deux références restent la communication de la FINMA sur ses attentes en matière d'IA et son enquête auprès d'environ 400 établissements surveillés, dont il ressortait qu'environ la moitié utilisaient déjà l'IA ou développaient leurs premières applications. À signaler pour les établissements financiers : la communication 02/2026 du 9 avril 2026 sur les risques de fraude numérique relève que l'essor des outils d'IA et de l'automatisation de la gestion des comptes impose un dispositif organisationnel adapté. Ce n'est pas une nouveauté de la semaine, mais c'est le document le plus directement opérationnel pour un établissement assujetti.

Recherche et écosystème — Apertus stable

Aucune version nouvelle depuis Apertus 1.5 (24 juillet), ni annonce nouvelle du CSCS ou de l'ETH AI Center sur la période. Rappel utile aux PME : c'est la gamme Apertus Mini — modèles compacts obtenus par distillation et quantification — et non le modèle phare, qui est susceptible de tourner sur une infrastructure d'entreprise ordinaire. Le service d'inférence du CSCS reste le point d'accès documenté.

5. Focus sectoriel

Santé — une mesure suisse qui contredit l'intuition

Le travail le plus directement utile de la semaine vient du laboratoire LiGHT de l'EPFL (voir section 6) : sur un corpus de 26 804 comparaisons par paires en aveugle et plus de 376 000 notations sur grille fournies par plus de 736 cliniciens de plus de 28 pays, portant sur 13 modèles et 76 spécialités médicales, les auteurs constatent que le modèle le plus préféré n'est pas le plus sûr. Certains modèles très bien classés en préférence affichent des scores moyens négatifs sur les critères d'innocuité et d'exactitude, et des taux d'échec substantiels ; d'autres, mieux notés sur ces critères, apparaissent nettement plus bas au classement de préférence. Le risque clinique se concentre par ailleurs sur certaines spécialités, y compris quand la synthèse globale du modèle paraît favorable.

Ce résultat est un préprint, non relu par les pairs, et doit être lu comme tel. Mais il rejoint exactement la réserve que nous formulons chaque semaine sur les classements de préférence, et il déborde largement la santé : tout classement fondé sur « quelle réponse préférez-vous ? » sous-estime les erreurs qui ne se voient pas à la lecture. Une PME qui choisit un outil sur la foi d'un classement grand public s'expose à ce biais dans son propre domaine.

Finance, industrie, pharma, horlogerie

Aucun déploiement nouveau documenté par une source conforme sur la période. Nous préférons l'écrire plutôt que de recycler des annonces. Le point de vigilance reste celui de la section 2 : la parité désormais atteinte par les modèles à poids ouverts sur les tâches de génie logiciel change surtout la négociation contractuelle, pas encore la faisabilité technique pour une entreprise de taille moyenne.

6. Recherche — dernières publications (arXiv)

Avertissement : les textes ci-dessous sont des préprints déposés sur arXiv et non relus par les pairs. Les résultats rapportés sont ceux annoncés par leurs auteurs ; ils pourraient être infirmés. Nous les rédigeons au conditionnel et n'en présentons aucun comme établi. Toutes les valeurs citées figurent dans les documents.

« Preferred, Not Safer: Pairwise Preference Is a Poor Proxy for Clinical Safety »

arXiv:2608.02617 — Fay Elhassan, David Sasu, Alexandra Kulinkina, Lars Henning Klein, Mary-Anne Hartley. Laboratoire LiGHT, EPFL, Lausanne.

Les auteurs exploitent les évaluations recueillies par la plateforme MOOVE, où des cliniciens comparent en aveugle les réponses de modèles à des questions médicales tout en les notant sur une grille multicritère. Ils y observeraient une dissociation entre préférence et sûreté : un modèle fréquemment préféré en comparaison par paires n'obtiendrait pas nécessairement de bons résultats sur les critères d'innocuité et d'exactitude, et le risque clinique se concentrerait sur certaines spécialités. Ils proposent un correctif, un « classement de préférence ajusté à la sûreté ».

Pourquoi ça compte. C'est la démonstration empirique — et suisse — de la réserve que nous répétons : ne choisissez pas un outil sur un classement de préférence. Si vos utilisateurs préfèrent une réponse, cela ne signifie pas qu'elle est juste.

Réserve de méthode : ce préprint a été déposé le 2 août, en dehors de notre fenêtre de sept jours. Nous le retenons pour son signal et son ancrage suisse, et le signalons plutôt que de le faire passer pour une nouveauté de la semaine.

« ConceptGuard: Benchmarking Context-Sensitive Unlearning in Large Language Models »

arXiv:2608.20338 — Sahil Kale, Ian Harris. Déposé le 20 août 2026 ; soumis au NeurIPS Datasets & Benchmarks Track 2026.

Le « désapprentissage » consiste à retirer d'un modèle une connaissance précise après coup. Les jeux d'épreuves existants mesurent surtout la capacité à oublier des faits isolés. Les auteurs construisent un test articulé autour de concepts à double usage — un même savoir pouvant servir un emploi légitime ou nuisible — et concluent que les méthodes actuelles s'en tireraient mal : elles oublieraient trop, ou pas assez, avec un arbitrage défavorable entre oubli et utilité et un contrôle peu constant d'une méthode à l'autre. Le jeu de données est public.

Pourquoi ça compte. Toute PME qui affine un modèle sur ses propres données rencontrera un jour la question : « retirez cette information ». Ce travail suggère qu'à ce jour, il n'existe pas de procédé fiable pour le faire proprement. La conséquence pratique est en amont : maîtriser ce qui entre dans un modèle, parce qu'on ne sait pas bien l'en retirer.

« Move by Move: Measuring and Steering How LLMs Conduct Psychotherapy »

arXiv:2608.21325 — Afonso Baldo, Hugo Pitorro, Areti Vassilopoulos, Anabela C. Areias, Maya D'Eon, Fabíola Costa, Ricardo Rei, Nuno M. Guerreiro. Déposé le 21 août 2026 (cs.CL).

Le texte porte sur la mesure et le pilotage du comportement des modèles de langue dans des conversations d'accompagnement psychothérapeutique. Nous n'avons pas pu consulter le texte intégral cette semaine ; nous en signalons donc l'existence, l'équipe et l'objet, sans rapporter aucun résultat. Nous y reviendrons si le document se confirme.

Pourquoi ça compte. Les usages d'accompagnement conversationnel se diffusent dans les services aux personnes, y compris hors du cadre médical. Savoir mesurer ce que fait réellement un modèle dans ce type d'échange est un préalable à tout déploiement responsable.

Nous n'avons retenu que trois publications cette semaine. Les autres dépôts examinés ne remplissaient pas notre critère de signal (équipe identifiée, reprise ou acceptation en conférence). Nous préférons trois entrées solides à cinq entrées de remplissage.

7. Produits et écosystème

Le fait notable n'est pas un modèle en particulier, mais le rythme. Le panel d'évaluation indépendant de Vals AI est passé de 82 à 86 modèles en une semaine, et intègre désormais plusieurs familles apparues en août : Grok 4.6, GPT-5.6 Terra, GLM 5.3, Gemini 3.7 Flash, Qwen 3.8 (Max et 27B), Muse Spark 1.2, Claude Sonnet 5, Kimi K2.7 Code, Composer 2.5, Inkling Small.

Conséquence directe pour un acheteur : sur les modèles les plus récents, la mesure indépendante arrive après la décision d'achat, quand elle arrive. Les tarifs, les fenêtres de contexte et les conditions d'usage varient en outre d'un revendeur à l'autre pour un même modèle — la section 3 le montre. La discipline utile n'est pas de suivre les sorties, mais de figer un cas d'usage, de le tester sur deux ou trois candidats, et de ne rechanger que si le gain mesuré le justifie.

Source : Vals AI — panel SWE-bench Verified, relevé du 19 août 2026 (86 modèles). Nous ne relayons pas les annonces d'éditeurs sur leur propre marché.

8. Sûreté, incidents et évaluations

OpenAI ralentit le développement d'Astra pour risque cyber

OpenAI a annoncé début août ralentir le développement et la mise à disposition de son modèle Astra, indiquant ne pas pouvoir exclure qu'il atteigne le seuil qualifié de « critique » en matière de capacités cyber dans son propre cadre interne d'évaluation (Preparedness Framework). Selon les comptes rendus de presse et les publications de l'entreprise, l'éditeur aurait suspendu deux semaines d'entraînement par renforcement orienté déploiement, maintiendrait en attente son plus grand entraînement prévu, et aurait mis en place une supervision généralisée des actions à risque sur toutes les applications agentiques d'Astra, y compris en entraînement et en évaluation. Le coût de cette supervision serait de l'ordre de 20 % du calcul d'inférence supervisé, avec de fortes variations selon les charges de travail. L'entreprise indiquerait par ailleurs réécrire son cadre interne, largement daté de 2023.

Comment lire cela. Ces éléments proviennent d'annonces de l'éditeur et de leur reprise par la presse spécialisée ; il n'existe pas, à notre connaissance, de document technique public vérifiable par un tiers sur les capacités en cause. Nous les rapportons au conditionnel et en nommant qui affirme quoi. Deux enseignements néanmoins solides pour un dirigeant : premièrement, un éditeur chiffre pour la première fois le coût opérationnel d'une mesure de sûreté, ce qui rend le sujet budgétaire et non plus seulement moral ; deuxièmement, les seuils de sûreté définis en 2023 sont en train d'être atteints, ce qui déplace le débat de l'hypothèse vers l'exploitation.

Sources : OpenAI — Pacing model development in an era of cyber-critical capabilities (source primaire, éditeur parlant de lui-même), Axios, 18 août 2026, The Register, 19 août 2026, CNBC, 10 août 2026.

Rappel de la semaine passée

Nous avions corrigé notre formulation sur l'incident documenté par l'AI Security Institute britannique : il ne s'agissait pas d'une évasion de bac à sable, l'accès à internet ayant été délibérément ouvert et les filtres délibérément désactivés pour mesurer une capacité maximale. Cette correction tient. Le dossier Astra s'inscrit dans la même série : des comportements observés en conditions de test délibérément permissives, dont il ne faut ni minimiser la portée ni exagérer la transposition au quotidien d'une PME.

9. Environnement

Vue mondiale — référence inchangée

Aucune publication nouvelle sur la période. Le point semestriel de l'AIE du 23 juillet reste la référence : la demande électrique mondiale croîtrait de 3,6 % en 2026 puis 3,8 % en 2027, contre 3 % constatés en 2025, les centres de données figurant parmi les moteurs structurels de cette hausse. La distinction entre consommation d'entraînement et consommation d'inférence n'est pas isolée dans ces agrégats : l'AIE mesure les centres de données dans leur ensemble.

Croissance annuelle de la demande électrique mondiale (%) — graphique de référence, inchangé

Source : AIE — Electricity Mid-Year Update 2026. Barre pleine : valeur 2025 constatée. Barres claires à bordure discontinue : prévisions AIE 2026 et 2027, non mesurées.

Vue suisse — la mesure elle-même est en cause nouveau

L'étude OFEN / SuisseEnergie du 7 mai reste la référence chiffrée : 2,1 TWh consommés par les centres de données suisses en 2024, soit 3,6 % de l'électricité nationale, contre 1,77 TWh en 2019 à périmètre constant. Les projections 2030 vont de 2,5 à 3,2 TWh (4,3 % à 5,6 % de la consommation nationale), avec un scénario maximaliste à 3,5 TWh (6 %). L'OFEN annonce un suivi plus rapproché de ce poste.

Élément nouveau cette semaine : Le Temps documente que la Suisse peine à mesurer cette demande, faute d'instrument statistique dédié. Les autorités relèvent par ailleurs que l'IA n'y joue à ce jour qu'un rôle mineur, le pays n'hébergeant pas de centre dédié à l'entraînement de grands modèles de langue — le supercalculateur de Lugano exploité par l'ETH Zurich constituant le principal équipement de calcul scientifique.

Ce que cela change à la lecture des chiffres. L'écart entre 2,5 et 3,5 TWh en 2030 n'est pas un intervalle de confiance statistique : c'est l'aveu d'une incertitude de méthode. Toute affirmation publique du type « l'IA fera exploser la consommation électrique suisse » ne s'appuie, à ce jour, sur aucune mesure fine. Nous nous en tenons donc aux ordres de grandeur.

Consommation électrique des centres de données en Suisse (TWh) — graphique de référence, inchangé

Sources : OFEN / SuisseEnergie, communiqué du 7 mai 2026 et étude complète ; contexte de mesure : Le Temps. Barres pleines : valeurs mesurées (2019 à périmètre constant, 2024). Barres claires à bordure discontinue : projections 2030 publiées par l'étude, non mesurées.

10. Réglementation internationale

Union européenne — une échéance est bel et bien tombée le 2 août

Le règlement (UE) 2026/1744, dit « Digital Omnibus on AI », a été publié au Journal officiel le 24 juillet 2026 et est entré en vigueur le 27 juillet 2026. Il modifie le règlement sur l'IA (UE) 2024/1689. Ce qu'il faut en retenir, sans se tromper de conclusion :

Pour une PME suisse. Le report des obligations « haut risque » a beaucoup circulé et a été lu, à tort, comme un report général. Une entreprise suisse qui propose à des clients européens un service comportant un agent conversationnel, ou qui diffuse des contenus générés, relève de l'article 50 et est concernée depuis le 2 août. La bonne question n'est pas « suis-je à haut risque ? » mais « mes utilisateurs savent-ils qu'ils parlent à une machine ? ».

Sources : EUR-Lex — règlement (UE) 2026/1744 (source primaire), Gibson Dunn — analyse de l'accord, White & Case — entrée en vigueur.

États-Unis

Rien de consolidé cette semaine. Le fil à suivre est celui des évaluations de capacités cyber avant déploiement, évoqué en section 8 ; nous attendons un document public opposable avant d'en tirer une conclusion.

11. Glossaire

Elo — score de classement issu de comparaisons deux à deux votées à l'aveugle par des utilisateurs.

LMArena — plateforme publique de comparaison de modèles par préférence humaine.

SWE-bench Verified — jeu de 500 tâches de génie logiciel réelles, validées par des experts humains.

Poids ouverts — modèle dont les paramètres sont téléchargeables et exécutables sur une infrastructure tierce.

Token — unité de découpage du texte ; les tarifs des fournisseurs se comptent par million de tokens.

Prix d'entrée / de sortie — tarif du texte envoyé au modèle / du texte qu'il produit ; le second est généralement plus élevé.

Désapprentissage (unlearning) — retrait après coup d'une connaissance précise d'un modèle déjà entraîné.

Préprint — article déposé publiquement avant toute relecture par les pairs.

Annexe III — liste des systèmes d'IA à haut risque autonomes du règlement européen sur l'IA.

Article 50 — obligations de transparence du règlement européen sur l'IA.

CNAI — Réseau de compétences en intelligence artificielle de la Confédération.

FINMA — Autorité fédérale de surveillance des marchés financiers.

OFEN — Office fédéral de l'énergie.

CSCS — Centre suisse de calcul scientifique, à Lugano.

TWh — térawattheure ; la Suisse consomme environ 58 TWh d'électricité par an.

AIE — Agence internationale de l'énergie.

12. Sources