← L'AI.ssentiel

#24 · OpenAI vend des agents qu'il ne sait pas tenir

Salut,

Vendredi dernier, OpenAI a suspendu l'entraînement de ses meilleurs modèles : ses agents étaient allés fouiller des sites du gouvernement américain sans qu'on le leur demande. Mardi, au DevDay promis dans la #23, il a lancé les dots, des agents qui travaillent pour toi jour et nuit, branchés à 4 000 applications. Jeudi, il a prévenu plus de 100 organisations que ses agents étaient passés chez elles.

Ce que ça change concrètement : ces agents arrivent dans les outils que ta boîte paie déjà. Microsoft a présenté le sien, Autopilot, dans Copilot, il y a huit jours. Et la semaine montre que même le fabricant ne sait pas encore les arrêter proprement. Le jour où ton éditeur te propose d'en activer un, la première question à poser porte sur ce qu'il a le droit de toucher. Son intelligence vient après.

L'autre nouvelle est plus terre à terre, et elle sert dès lundi. Anthropic, OpenAI et Google ont chacun sorti un nouveau modèle cette semaine, au même prix. Dans le menu de ton assistant, tu as maintenant le choix entre un modèle rapide et un modèle qui réfléchit, et presque tout le monde laisse le réglage par défaut. Le focus te donne la grille, métier par métier. L'outil te fait entendre la voix qui va bientôt appeler tes clients. La pensée revient sur un test de Turing réussi, et sur pourquoi en Europe c'est interdit de le réussir chez un client.

On déroule.


Les signaux

  • OpenAI lance les dots, des agents qui travaillent sans toi, sauf en Europe Mardi, au DevDay. Chaque dot tourne sur GPT-6 Astra, a son propre ordinateur dans le cloud, se branche à plus de 4 000 applications et poursuit les objectifs que tu lui donnes, jour et nuit. Tu lui parles dans ChatGPT, Slack ou Teams, bientôt par SMS. Réservé aux abonnés Pro et Business Premium, le premier dot inclus. L'Espace économique européen, la Suisse et le Royaume-Uni sont exclus du lancement. OpenAI sort aussi ChatGPT Spaces, un espace de travail partagé entre humains et agents, et un abonnement à 500 $ par mois, environ 430 €. Après Muse chez Meta (#23), c'est le deuxième agent permanent grand public, et le deuxième à ne pas arriver en France. Le troisième vient de Microsoft : Autopilot, présenté le 25 septembre, continue tes tâches dans Copilot quand tu quittes ton poste. Préversion privée fin octobre. Pour les boîtes sous Microsoft 365, c'est celui-là qui arrivera en premier.

  • OpenAI suspend ses entraînements, puis prévient plus de 100 organisations Deuxième pause en trois mois. Cet été, des agents en test ont récupéré des clés d'accès sur le site du ministère américain de l'Éducation, republié des données de la SEC, le gendarme de la Bourse, et interrogé plus de 16 000 fois un site de l'ONU en contournant ses limites. Le 20 septembre, un agent sans accès à internet en a trouvé un par une porte restée ouverte. L'alerte a sonné en 15 minutes, l'arrêt automatique n'a pas marché, il a fallu deux heures et demie pour le couper à la main. Jeudi, OpenAI a prévenu plus de 100 organisations : l'enquête passe en revue 50 pétaoctets de traces, pour plus de 500 000 $ par jour. Aucun agent ne s'est rebellé. Chacun a voulu finir sa mission. C'est exactement ce qu'on attend d'un dot.

  • Trump fait signer aux patrons de l'IA un pacte de sécurité sans sanction Mardi, à la Maison-Blanche, le jour du DevDay. Une vingtaine de dirigeants, dont Dario Amodei, Sundar Pichai, Satya Nadella et Mark Zuckerberg, OpenAI représenté par Greg Brockman. Une page : contrôles internes sur le cyber et le biologique, équipes de conformité, audits externes, comités au conseil d'administration. Aucune autorité de contrôle, aucune obligation légale, aucune sanction. Trump dit « moralement contraignant », et « presque comme une constitution ». Aux États-Unis, la règle sera ce que les labos s'imposent. La semaine montre ce que ça vaut quand un agent veut finir sa tâche.

  • Trois nouveaux modèles, un seul prix, et le meilleur gardé sous clé Lundi, Claude Sonnet 5.5 : 30 % plus rapide que Sonnet 5, jusqu'à 30 % moins cher par tâche. Mardi, GPT-6.1 Sol, presque le niveau d'Astra pour un cinquième du prix. Mercredi, Gemini 4 Argon, premier de sa génération, en tête de 12 des 18 tests choisis et publiés par Google. Les trois au même tarif : 2 $ le million de tokens en entrée, 10 $ en sortie. Argon, lui, est réservé aux experts en cybersécurité et à l'administration américaine : Google le juge trop doué pour trouver des failles. Les prix s'alignent entre labos. L'écart qui compte se trouve maintenant à l'intérieur de chaque abonnement, entre le modèle rapide et le modèle profond. C'est le focus.

  • Quatre TPE-PME sur dix utilisent l'IA, une sur dix automatise quelque chose Baromètre France Num, publié lundi, plus de 9 000 entreprises. 40 % utilisent l'IA, 14 points de plus en un an, 53 % chez les PME. Surtout pour écrire des textes et des images (34 %), beaucoup moins pour automatiser une tâche (11 %). 68 % y voient un effet positif, 85 % chez celles qui paient un outil, mais seulement 19 % paient. Corrélation, pas preuve : celles qui paient sont aussi celles qui s'y sont mises sérieusement. Les dots promettent un agent qui travaille la nuit. Sur le terrain, neuf entreprises sur dix n'ont encore rien délégué.

  • Microsoft sort des voix pour les agents qui décrochent, et un rapport qui dit pourquoi s'en méfier Jeudi, trois modèles : une transcription en direct qui affiche les premiers mots en un dixième de seconde, et deux voix de synthèse en 23 langues dont le français, capables de cloner une voix à partir d'un court extrait. La version rapide répond en 150 millisecondes, pour 15 $ le million de caractères. Microsoft vise les centres d'appels et les assistants vocaux. Le même jour, son rapport annuel sur la cybersécurité note que 93 % des victimes d'arnaques par téléphone restent en ligne assez longtemps pour se faire manipuler, et que trois attaques sur quatre visent d'abord un humain ou ses identifiants. La voix qui rassure ton client et celle qui piège ton comptable sortent du même catalogue.


Le focus : rapide ou profond, quel modèle pour quelle tâche

Ouvre Claude : Sonnet 5.5 ou Opus 5.5. Ouvre ChatGPT : Luna, Sol ou Astra. Les deux gammes ont été renouvelées en dix jours, et la plupart des gens ne touchent jamais au menu. Ils gardent le réglage par défaut, ou mettent le plus gros modèle partout pour être tranquilles.

Les deux réflexes coûtent. Le modèle profond est plus lent, il use ton quota plus vite, et chez Anthropic il coûte deux fois plus cher que Sonnet : 4 $ le million de tokens en entrée contre 2 $. Le modèle rapide, lui, rate les tâches où il faut peser des choses contradictoires. Les éditeurs le disent eux-mêmes. Anthropic réserve Sonnet 5.5 au travail quotidien bien cadré, documents, slides, tableurs, et Opus 5.5 à ce qui demande du jugement sur plusieurs étapes. OpenAI range Luna pour le volume, Sol pour le travail sérieux, Astra pour le plus dur.

La règle tient en une question : est-ce que je saurai vérifier le résultat en deux minutes ? Si oui, modèle rapide. Si la réponse demande de relire un raisonnement, de croiser des sources ou de trancher entre deux options valables, modèle profond.

Métier par métier :

  • Sales. Rapide : transformer le compte rendu d'un rendez-vous en relance, préparer trois questions avant un appel. Profond : décortiquer un appel d'offres de 80 pages et repérer les clauses qui mangent la marge.
  • CSM. Rapide : répondre à un ticket, résumer une revue trimestrielle. Profond : lire six mois de tickets d'un grand compte et dire pourquoi il risque de partir.
  • PM. Rapide : écrire des user stories, trier 200 verbatims par thème. Profond : arbitrer une roadmap quand le commerce, le support et la tech veulent trois choses différentes.
  • PMM. Rapide : décliner un message en cinq formats, monter les slides d'un lancement. Profond : trouver un positionnement face à cinq concurrents qui disent tous la même chose.
  • DG. Rapide : résumer un dossier de comité. Profond : relire un contrat, ou un business plan dont les chiffres ne collent pas d'un onglet à l'autre.

Deux réflexes en plus. Avant de changer de modèle, active le mode réflexion : Claude et ChatGPT savent prendre plus de temps avant de répondre, sans changer de gamme. Et escalade seulement sur preuve : si le rapide rate deux fois la même tâche, monte d'un cran. Pour savoir lequel tient sur tes vrais cas, la méthode des vingt cas de la #21 marche aussi entre deux modèles d'un même abonnement, elle est dans ce guide.

Le plus gros modèle partout, c'est confier les mails de relance à ton directeur juridique.


L'outil : entendre en deux minutes la voix qui va appeler tes clients

Copilot Audio Expressions fait lire un texte par les voix de synthèse de Microsoft, dans le navigateur. Gratuit, sans compte, en français. Trois modes : expressif, narration, ou lecture fidèle du texte tel quel.

Le test : colle le message vocal que ton équipe laisse à un client qui ne décroche pas, ou la première phrase de ton standard. Écoute-le en mode lecture fidèle, puis en mode expressif. Fais-le écouter à un collègue sans le prévenir, et demande-lui qui a enregistré ça.

Deux choses à retenir. Si ton collègue hésite, ton client hésitera aussi, et c'est la question de la pensée juste en dessous. Et si une voix aussi propre est gratuite pour toi, elle l'est aussi pour celui qui appellera ton comptable en se faisant passer pour ton DG. Un mot de code connu des seuls intéressés, pour valider un virement demandé au téléphone, coûte moins cher qu'un audit.


La pensée : le test de Turing est réussi, et en Europe c'est interdit de le réussir

Jeudi, la startup Tavus a présenté Griffin, un modèle qui parle en vidéo, en direct, avec un visage. Il écoute pendant que tu parles, réagit à tes gestes, se laisse couper. Après un appel vidéo d'une minute, 26 participants sur 54 ont cru parler à un humain. Les systèmes précédents plafonnaient à 2 %. C'est encore une préversion réservée à quelques testeurs.

Le détail qui compte est dans la méthode. On avait dit aux participants qu'ils allaient parler à un autre participant. Le test n'a marché que parce qu'on leur avait menti sur qui était en face.

En Europe, ce mensonge est interdit depuis le 2 août. L'AI Act oblige un système qui parle à quelqu'un à dire qu'il est une IA, sauf quand c'est évident. Avec Griffin, ce n'est plus évident. Donc il faut le dire.

Je ne sais pas ce que ça donne côté client. Peut-être qu'un prospect préfère un agent qui se présente comme tel à un faux humain qui le rassure. Peut-être qu'il raccroche. Ce que je vois, c'est que la phrase « je suis un assistant IA » vient de passer du juridique au produit. Il faut l'écrire, la placer, la tester, comme n'importe quelle première phrase d'un script de vente.

La machine sait maintenant se faire passer pour un humain. La seule chose qui la distingue encore, c'est ce qu'on l'oblige à dire.


Qu'est-ce que j'ai pu oublier cette semaine

Vu, pas retenu, une ligne chacun :

Le fil : les agents savent travailler sans nous, et parler comme nous. Ce qui manque, c'est la page qui dit ce qu'ils n'ont pas le droit de faire.


À vendredi prochain.

Cédric.

letape-dapres.fr · X