Jean-Luc Durand

Les modèles d'interaction humains

Depuis l'apparition de ChatGPT en 2022, j'ai l'impression de revivre les années 1985-1995, lorsque l'informatique grand public faisait ses premiers pas. À cette époque il y avait des nouveautés tous les mois. Un ordinateur acheté à un instant t était obsolète deux ans après. L'« effet waouh » était régulier. Aujourd'hui, on dirait qu'une nouvelle période similaire recommence. Les progrès sont si rapides que la technologie est en train de rattraper la fiction. Je veux parler (une fois encore !) de l'IA.

Cette fois-ci ça sera sous un autre angle, celui de l'interaction avec l'être humain. Pour le moment on a l'habitude de discuter avec Claude ou Gemini par voie de texte. C'est facile à faire, pratique et nécessaire pour certaines tâches, notamment lorsqu'il s'agit de traiter des documents.

Toutefois la base des échanges, c'est de se parler. C'est d'avoir une personne en face de vous et d'échanger avec elle. De pouvoir discuter de façon non scriptée, c'est-à-dire par exemple interrompre l'interlocuteur et non pas être obligé d'attendre qu'il ait fini sa phrase.

Aujourd'hui on peut déjà en avoir un avant-goût avec le mode vocal de ChatGPT par exemple. Vous parlez à votre téléphone, il y a un petit temps de latence pour le traitement des données, et la voix vous répond. J'ai ce même système de discussion audio avec Grok dans ma voiture, et cela amuse beaucoup mon jeune fils.

Ce qui est frustrant avec ce système, c'est justement cette petite latence qui vous oblige à attendre quelques secondes la réponse. Le délai est court mais suffisant pour que l'échange ne soit pas complètement naturel. Chacun parle, puis écoute la réponse de l'autre, comme avec un bon vieux talkie-walkie. Et surtout, il est purement vocal. Vous n'avez pas un visage en face de vous. Difficile, dans ces conditions, d'oublier que vous échangez avec une machine.

Tout ceci pourrait être bientôt terminé. Bienvenue dans l'ère des assistants interactifs, également appelés Modèles d'interaction humains (MIH). Et si vous voulez savoir à quoi ça ressemble, je vous propose de regarder Griffin de l'entreprise américaine Tavus. Oui, malheureusement, ce qui impressionne vient rarement d'Europe.

Griffin se présente sous la forme d'un simple logiciel qui utilise la caméra de votre ordinateur portable. Sur l'écran vous voyez deux vidéos, vous-même et un interlocuteur. Le principe est le même qu'avec Microsoft Teams ou FaceTime d'Apple, par exemple. Mais regardez la capture d'écran ci-dessous. La jeune femme souriante, en haut à gauche, n'existe pas.

Tavus Griffin

Crédits photo : capture d'écran Tavus

Pourtant elle parle avec l'utilisateur et surtout elle le fait de façon totalement naturelle. Car bien évidemment, pour imiter correctement un humain, il ne faut pas négliger les petits détails.

Tout d'abord la représentation physique de la jeune femme est parfaite. Non seulement son visage a les imperfections de celui d'un être humain, mais surtout il est totalement animé. Tout bouge : les lèvres, bien sûr, avec une synchronisation parfaite avec la parole, les yeux, les sourcils, et même le corps qui simule le balancement d'une personne assise sur une chaise rotative. Ses expressions suivent le ton et le fond de ce qu'elle dit.

Mais il y a une autre innovation incroyable, c'est la réactivité. Le système fonctionne en full duplex. C'est un concept qui m'est familier, pour travailler dans les réseaux informatiques, mais qu'il faut peut-être expliquer un minimum. L'idée, c'est que la voix et l'image ne vont pas d'abord dans un sens, puis dans un autre. Elles peuvent aller simultanément dans les deux à la fois, et se croiser si besoin.

En pratique qu'est-ce que ça veut dire ? Griffin n'attend pas que vous ayez fini de parler pour analyser ce que vous dites. Elle le fait en temps réel. Elle tient compte des mots que vous prononcez bien sûr, mais aussi de toutes vos micro-expressions, notamment sur le visage, des silences, des hésitations, et réagit immédiatement.

Si par exemple vous dites avec un air gêné « Ce matin je n'avais pas mis mon réveil et heu... j'ai raté mon train », ChatGPT attendra la fin de la phrase et adaptera sa réponse. Griffin, elle, se mettra à rire (oui, à rire) dès qu'elle entendra le « heu » car, comme un être humain, elle ne sait pas ce que vous allez dire ensuite, mais elle perçoit déjà le comique de la situation (votre visage et les conséquences certainement désagréables du retard).

Tout cela participe à un réalisme sidérant. C'en est presque dérangeant, car une personne pourrait ne pas se rendre compte qu'elle parle à une IA. Pour en avoir une idée, regardez la vidéo de présentation qui est proposée sur le site.

Tavus affirme que 48% des personnes invitées à parler avec Griffin, et qui (volontairement) n'avaient pas été prévenues de sa vraie nature, ne l'ont pas remarqué. Parvenir à abuser un être humain sur deux est déjà une performance remarquable. Je vous laisse imaginer ce qu'on pourra faire dans dix ou vingt ans.

Alors à quoi ça sert ? J'ai envie de vous dire que le simple fait que ce soit possible ouvre un immense champ d'application ! Mais soyons plus précis tout de même.

Jusqu'ici on parlait souvent à des voix enregistrées, à des répondeurs ou à des pseudo-assistants qui se limitent à des phrases pré-enregistrées. Les opérateurs de télécommunications, et notamment leur SAV, en sont des grands spécialistes... Avec ces nouvelles technologies vous pourrez vous croire véritablement en face d'un être humain.

Je dis « croire », car évidemment le but est d'éliminer l'homme de l'équation. Pour des raisons de coûts bien sûr, ce type de fonction risque d'avoir un très grand succès dans les services de support client. Lorsque vous appellerez un fournisseur quelconque pour faire part d'un problème ou poser une question, vous serez reçu d'abord par l'agent IA. Celui-ci pourra vous aider sans jamais s'agacer, vous consacrera tout le temps qu'il faudra et ne passera la main à un « véritable être humain » que si c'est vraiment indispensable.

Bien sûr il y a encore beaucoup de détails à régler. Le plus important est de s'assurer que ces technologies ne servent pas à arnaquer les gens. Par exemple on peut imaginer qu'une petite icône en haut de l'écran indique que l'on parle à une personne virtuelle. Mais on peut être sûr que certains parviendront à l'effacer. Le défi des prochaines années ne sera pas seulement de perfectionner les MIH, mais aussi de les encadrer.

Un autre champ d'application possible sera le compagnon virtuel. Si on peut générer un visage humain, familier, capable d'interagir avec vous sur un ton léger, de faire preuve d'empathie, alors qu'est-ce qui empêche d'en faire une sorte d'ami ? Voire plus... C'est le thème qui est exploré par le film de science-fiction Her de 2013. Le personnage principal, interprété par Joaquin Phoenix, tombe amoureux de Samantha, une IA informatique.

Et le plus incroyable est que celle-ci est finalement beaucoup moins moderne que dans la réalité. Car Samantha est juste une voix. Elle n'a aucune apparence physique. Aujourd'hui, en 2026, on a le son et l'image. La technologie n'a pas seulement rattrapé la fiction, elle l'a dépassée. Qui sait seulement jusqu'où elle ira ?

#IA