-
Pérou: évacuation de plus de 600 personnes sur un axe routier bloqué depuis cinq jours
-
Un navire sud-coréen sur le départ pour la route maritime de l'Arctique
-
L'heure tourne mais toujours pas d'accord commercial entre les Etats-Unis et le Canada
-
Ukraine : frappes russes meurtrières sur un centre commercial en plein jour
-
Trump, pressé de faire baisser les prix, lève temporairement les taxes sur le boeuf importé
-
Pérou : évacuation de plus de 300 personnes sur un axe routier bloqué depuis cinq jours
-
Ligue 1: sans recrue mais avec sérieux, l'OM débute parfaitement
-
Athlétisme: Audrey Werro enchaîne à Lausanne, Shericka Jackson se blesse
-
Wall Street termine une semaine mitigée sur une note positive
-
Ukraine : au moins 19 morts et plus de 130 blessés dans des frappes russes
-
L'attaque à l'épée dans un lycée en Suède fait un mort et trois blessés
-
Foot: les Girondins au bord du précipice après leur relégation confirmée en justice
-
Bolivie : le président Paz contraint de limoger son ministre de l'Economie en pleine crise
-
Meghan bientôt de retour au Royaume-Uni, malgré les blessures passées
-
Ukraine: au moins 18 morts et plus de 120 blessés dans des frappes russes
-
Cyclisme: Julian Alaphilippe annonce "la fin de sa carrière sportive" (réseaux sociaux)
-
Sous pression avant les élections, Trump réduit les taxes sur du boeuf importé
-
En Champagne, le défi des vendanges ultra-précoces cette année
-
Le méga-zoo Vantara du fils d'un magnat indien annonce un changement de cap
-
Des dizaines de milliers de préservatifs "non conformes" vendus en France ces derniers mois
-
Harry et d'autres célébrités contraintes de verser 9,5 millions de livres au Daily Mail
-
Attaque à l'épée dans un lycée en Suède: au moins trois blessés
-
Familles de France et la CGT s’inquiètent d’une remise en cause des avantages familiaux
-
La Bourse de Paris met fin à huit séances de baisse consécutives
-
Entre William et Harry, une réconciliation toujours hors d'atteinte
-
Influenceuse tuée dans le Gard : le suspect est un homme au lourd profil judiciaire
-
La forêt de Fontainebleau, en partie ravagée en juillet par le feu, rouvre au public samedi
-
Bronchiolite des bébés: deux traitements préventifs mieux remboursés
-
Tennis: trahi par un genou, Sinner renonce à l'US Open
-
Budget: le gouvernement en mode déminage et ballons d'essai avant un automne laborieux
-
Finale du Mondial-2026: l'Argentin Leandro Paredes suspendu dix matches par la Fifa
-
Le président iranien veut mettre fin à la guerre, jugeant l'Iran "en position de force"
-
Influenceuse du Gard: un suspect mis en examen pour assassinat
-
Wall Street repart en hausse grâce au retour de l'appétit pour le risque
-
"Il paraît que je vous ai manqué": Mélania Trump de retour après un mois à l'écart du public
-
Euro de volley: lancement réussi pour les Bleues
-
Délinquance: le Japon met fin à son partenariat avec une émission controversée de Netflix
-
"Bouclier oriental": des soldats polonais et allemands sécurisent la frontière entre l’Otan et la Russie
-
Norvège: toujours hospitalisé, le roi Harald, 89 ans, annule des engagements
-
Grèce : capture d'une louve recherchée pour avoir attaqué un enfant
-
Trump veut plus de 1.000 lancements spatiaux par an depuis les Etats-Unis
-
"Merci pour tout, Loulou": les Grands Tours saluent Alaphilippe
-
L'épidémie d'Ebola en RDC "progresse de façon exponentielle", alerte l'ONU
-
Le Japon proteste contre des essais de missiles russes au large d'îles disputées
-
L'automne à Paris: pourquoi sécheresse et canicule font tomber les feuilles
-
A l'ère des drones, l'entraînement à l'ancienne de recrues ukrainiennes
-
El Niño: le canal de Panama réduit son trafic face à la baisse des précipitations
-
Dans les logements inadaptés aux canicules, des morts de chaud par milliers
-
Présidentielle: Gabriel Attal de nouveau ciblé par des opérations de désinformation russes
-
Tour d'Espagne: Pogacar a une nouvelle page à écrire en complétant sa trilogie
L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent
Les derniers modèles d'intelligence artificielle (IA) générative ne se contentent plus de suivre les ordres et vont jusqu'à mentir, manigancer ou menacer pour parvenir à leurs fins, sous le regard inquiet des chercheurs.
Menacé d'être débranché, Claude 4, le nouveau-né d'Anthropic, fait du chantage à un ingénieur et menace de révéler une liaison extra-conjugale. L'o1 d'OpenAI essaye lui de se télécharger sur des serveurs extérieurs et nie lorsqu'on le prend la main dans le sac.
Pas besoin d'aller fouiller dans la littérature ou le cinéma, l'IA qui se joue de l'homme est désormais une réalité.
Pour Simon Goldstein, professeur à l'université de Hong Kong, ces dérapages tiennent de l'émergence récente des modèles dits de "raisonnement", capables de travailler par étapes plutôt que de produire une réponse instantanée.
o1, version initiale du genre pour OpenAI, sorti en décembre, "a été le premier modèle à se comporter ainsi", explique Marius Hobbhahn, patron d'Apollo Research, qui teste les grands programmes d'IA générative (LLM).
Ces programmes tendent aussi parfois à simuler "l'alignement", c'est-à-dire à donner l'impression qu'ils se plient aux consignes d'un programmeur tout en poursuivant, en fait, d'autres objectifs.
Pour l'heure, ces traits se manifestent lorsque les algorithmes sont soumis à des scénarios extrêmes par des humains, mais "la question, c'est de savoir si les modèles de plus en plus puissants auront tendance à être honnêtes ou pas", estime Michael Chen, de l'organisme d'évaluation METR.
"Les utilisateurs poussent tout le temps les modèles aussi", fait valoir Marius Hobbhahn. "Ce que nous observons est un vrai phénomène. Nous n'inventons rien."
Beaucoup d'internautes évoquent, sur les réseaux sociaux, "un modèle qui leur ment ou invente. Et ce ne sont pas des hallucinations, mais une duplicité stratégique", insiste le co-fondateur d'Apollo Research.
Même si Anthropic et OpenAI font appel à des sociétés extérieures, comme Apollo, pour étudier leurs programmes, "davantage de transparence et un accès élargi" à la communauté scientifique "permettraient de meilleures recherches pour comprendre et prévenir la tromperie", suggère Michael Chen.
Autre handicap, "le monde de la recherche et les organisations indépendantes ont infiniment moins de ressources informatiques que les acteurs de l'IA", ce qui rend "impossible" l'examen de grands modèles, souligne Mantas Mazeika, du Centre pour la sécurité de l'intelligence artificielle (CAIS).
Si l'Union européenne s'est dotée d'une législation, elle concerne surtout l'utilisation des modèles par des humains.
Aux Etats-Unis, le gouvernement de Donald Trump ne veut pas entendre parler de régulation et le Congrès pourrait même bientôt interdire aux Etats d'encadrer l'IA.
- L'IA en justice? -
"Il y a très peu de prise de conscience pour l'instant", constate Simon Goldstein, qui voit néanmoins le sujet s'imposer dans les mois à venir avec la révolution des agents IA, des interfaces à même de réaliser seules une multitude de tâches.
Les ingénieurs sont engagés dans une course derrière l'IA et ses dérives, à l'issue incertaine, dans un contexte de compétition féroce.
Anthropic se veut plus vertueux que ses concurrents, "mais il essaye en permanence de sortir un nouveau modèle pour dépasser OpenAI", selon Simon Goldstein, une cadence qui offre peu de temps pour des vérifications et corrections éventuelles.
"En l'état, les capacités (de l'IA) se développent plus rapidement que la compréhension et la sécurité", reconnaît Marius Hobbhahn, "mais nous sommes toujours en mesure de rattraper notre retard".
Certains pointent dans la direction de l'interprétabilité, une science récente qui consiste à décrypter de l'intérieur le fonctionnement d'un modèle d'IA générative, même si d'autres, notamment le directeur du CAIS, Dan Hendrycks, sont sceptiques.
Les combines de l'IA "pourraient gêner son adoption si elles se multiplient, ce qui constitue une forte incitation pour les entreprises (du secteur) à résoudre" ce problème, selon Mantas Mazeika.
Simon Goldstein évoque, lui, le recours à la justice pour mettre au pas l'intelligence artificielle, en se tournant vers les sociétés en cas de sortie de route.
Mais il va plus loin et propose même de "tenir légalement responsables" les agents IA "en cas d'accident ou de crime".
I.Yassin--SF-PST