Identifier les intervenants : nommer qui parle dans une transcription

Identifier les intervenants dans ThinkScribe : nommer Intervenant 1 une fois, enregistrer la voix d'un collègue, corriger une étiquette, fusionner des doublons.

Une transcription de réunion n'est utile que si l'on sait qui a dit quoi. C'est tout l'intérêt de l'identification des intervenants : ThinkScribe sépare les voix automatiquement, les étiquette Intervenant 1, Intervenant 2 et ainsi de suite, puis, dès que vous nommez une voix, s'en souvient. Le prochain enregistrement avec la même personne arrive déjà étiqueté. Ce guide montre comment nommer, enregistrer, corriger et fusionner des intervenants sur Mac et sur iPhone.

Une transcription sur iPhone avec des intervenants nommés

Comment fonctionne l'identification des intervenants

Tout enregistrement qui contient plus d'une voix passe, après la transcription, par deux étapes sur votre appareil (vous voyez « Identification des locuteurs… ») : l'audio est découpé en tours de parole selon la voix, puis chaque tour est comparé aux voix que vous avez déjà nommées. Une voix connue reçoit son nom ; une voix inconnue reçoit une étiquette générique. Le nombre d'intervenants est détecté automatiquement, et vos enregistrements comme vos voix ne nous sont jamais envoyés.

Les réglages se trouvent dans Réglages > Identification du locuteur sur iPhone, et dans Réglages > IA et modèles sur Mac. Sur Mac, ainsi que sur les iPhone et iPad dotés de 8 Go de mémoire, ThinkScribe télécharge aussi une seule fois un meilleur modèle d'intervenants, qui aide pour les enregistrements difficiles. Il n'y a rien à régler : tant qu'il n'est pas prêt, le modèle standard est utilisé.

Ce qu'est vraiment une empreinte vocale

Le mot empreinte n'est pas choisi au hasard, et il explique la plupart des résultats que vous verrez.

Tout système qui reconnaît les voix transforme un passage de parole en une liste de nombres, généralement quelques centaines. Cette liste décrit la voix plutôt que les mots : hauteur, timbre, résonance du conduit vocal, rythme de parole. Deux extraits de la même personne prononçant des phrases totalement différentes se retrouvent proches ; deux personnes différentes se retrouvent plus éloignées. Ces nombres ne disent rien à un lecteur humain : ils décrivent une voix, pas ce qui a été dit.

Nommer une voix, c'est ranger cette liste sous un nom. Dans un enregistrement ultérieur, chaque passage de parole devient une nouvelle liste, comparée à celles qui sont enregistrées, ce qui donne un score de similarité. Au-dessus du seuil, le nom est appliqué ; en dessous, la voix est traitée comme celle de quelqu'un de nouveau.

Ce seuil est un compromis auquel aucun réglage n'échappe. Trop souple, et un collègue à la voix proche hérite de votre nom. Trop strict, et vous devenez un nouvel intervenant le matin où vous êtes enrhumé. C'est pourquoi corriger une étiquette compte plus qu'il n'y paraît : la correction est la seule information que reçoit le système sur l'endroit où la limite était mal placée. Comment fonctionnent la diarisation et la reconnaissance des locuteurs (en anglais) décrit toute la chaîne.

Comment nommer un intervenant dans une transcription

Le plus simple pour instruire ThinkScribe est de nommer les gens au fil de la lecture.

  1. Ouvrez une transcription qui affiche Intervenant 1, Intervenant 2, etc.
  2. Touchez une ligne pour entendre qui parle, afin d'être sûr de savoir quelle étiquette correspond à qui.
  3. Sur iPhone ou iPad, maintenez le doigt sur le badge de l'intervenant et choisissez Renommer le locuteur…. Sur Mac, utilisez Renommer le locuteur… sur le badge de l'intervenant.
  4. Saisissez le nom de la personne, ou choisissez-la dans Locuteurs connus (Intervenants connus sur Mac) si vous l'avez déjà nommée.
  5. Confirmez. Toutes les lignes portant cette étiquette sont mises à jour, et la voix est enregistrée.

Désormais, les voix enregistrées sont reconnues automatiquement dans les nouveaux enregistrements. Quand ThinkScribe n'est pas tout à fait sûr, il affiche des Correspondances possibles pour que vous puissiez Confirmer ou Refuser le nom.

Enregistrer quelqu'un volontairement

Si vous voulez qu'un collègue ou un client soit reconnu avant sa première réunion, enregistrez sa voix avec un extrait propre.

  1. Sur iPhone, ouvrez Réglages > Identification du locuteur > Gérer les locuteurs connus. Sur Mac, ouvrez Réglages > IA et modèles et cliquez sur Gérer… à côté de Intervenants connus.
  2. Choisissez Ajouter un intervenant.
  3. Saisissez le nom, puis enregistrez la personne parlant seule pendant 20 à 30 secondes, ou importez un enregistrement où elle est la seule à parler. Un message vocal qu'elle vous a envoyé fait très bien l'affaire.
  4. Enregistrez le nouvel intervenant.

Des extraits plus longs et plus propres donnent une meilleure reconnaissance. Un extrait avec deux voix ou de la musique en fond brouille le profil.

Pourquoi une personne est parfois séparée en deux intervenants

C'est la plainte la plus fréquente pour tout système d'étiquetage des intervenants, et la cause se trouve presque toujours dans l'audio plutôt que dans le logiciel.

  • Les répliques courtes. Une réponse d'un mot, c'est moins d'une demi-seconde de parole, trop peu pour une empreinte stable. Les courtes interjections se rattachent à la personne qui parlait autour d'elles, ou deviennent un intervenant à part entière.
  • Les voix qui se chevauchent. Quand deux personnes parlent en même temps, le segment contient les deux voix et son empreinte tombe entre les deux. Personne ne lui correspond bien, alors il devient quelqu'un de nouveau.
  • Une voix changée. Un rhume, une voix enrouée le matin, parler fort par-dessus le bruit ou simplement la fatigue décalent assez les nombres pour manquer le seuil.
  • Un autre micro. Un casque, le micro d'un portable et un téléphone posé sur la table captent la même voix de façon très différente ; quelqu'un qui rejoint la seconde moitié d'une réunion depuis un autre appareil arrive donc souvent comme un nouvel intervenant.
  • La distance et la pièce. S'éloigner du micro mêle davantage la pièce à la voix : une personne qui commence assise à la table et finit par faire les cent pas peut être coupée en deux.
  • L'audio de téléphone et d'appel. Les appels sont compressés, débarrassés du bruit et limités en bande passante, ce qui retire des détails sur lesquels repose l'empreinte.

L'erreur inverse, deux personnes sous une même étiquette, a les mêmes origines : voix proches, micro éloigné, ou trop peu de parole de la part de la personne la plus discrète.

Que faire quand une étiquette est fausse

Corrigez les étiquettes tant que vous vous souvenez de la réunion, et partez du premier passage où la voix est nette plutôt que d'un passage au milieu d'un chevauchement.

  • Une personne, deux étiquettes dans une transcription : utilisez Renommer le locuteur… sur la seconde étiquette et choisissez la même personne dans Locuteurs connus.
  • Une personne, deux voix enregistrées : ouvrez les intervenants connus (Gérer les locuteurs connus sur iPhone, Gérer… sur Mac) et utilisez Fusionner pour les réunir.
  • Deux personnes, une étiquette : enregistrez la seconde personne avec un extrait propre via Ajouter un intervenant, pour que les prochains enregistrements disposent de deux voix distinctes à comparer.
  • Mauvais nom sur une voix connue : renommez le badge avec la bonne personne. Quand ThinkScribe propose des Correspondances possibles, refusez les mauvaises pour qu'il apprenne où passe la limite.
  • Une voix que vous ne voulez plus garder : supprimez-la des intervenants connus.

Entretiens, tables rondes, cours et appels

La situation d'enregistrement décide du travail qui vous reste ensuite, et les quatre cas courants se comportent très différemment.

Un entretien est le cas facile : deux voix qui alternent, près du micro. Enregistrez votre voix, laissez l'invité être étiqueté automatiquement, puis renommez-le une fois après coup. Des étiquettes cohérentes comptent surtout pour les transcriptions d'entretiens de recherche (en anglais), où l'attribution se retrouve dans l'analyse.

Une table ronde est le cas difficile : cinq ou six voix, des interruptions fréquentes, souvent un seul micro pour la salle. Attendez-vous à plus d'intervenants que de personnes, à ce que le participant le plus discret soit fusionné avec quelqu'un d'autre, et prévoyez un passage pour fusionner et renommer. Un tour de présentation au début aide beaucoup, car il donne tôt à chaque voix un extrait propre et sans interruption.

Un cours se situe entre les deux. Une voix domine et se reconnaît facilement, et les questions de la salle arrivent comme des intervenants distincts, ce qui permet de les retrouver facilement même si les personnes qui les posent ne sont jamais nommées.

Un appel téléphonique ou vidéo est limité par son audio plutôt que par le nombre de personnes. La compression et la réduction du bruit retirent des détails, et certaines apps d'appel mélangent tous les participants distants dans un seul canal, ce qu'aucun logiciel ne peut défaire. Pour un appel en tête-à-tête enregistré sur Mac avec le Micro et l'Audio système, votre côté et celui de l'appel proviennent de sources distinctes, ce qui donne une longueur d'avance à la séparation.

Pour les réunions en présentiel, posez le téléphone à plat au milieu de la table pour que chaque voix passe bien, et la transcription d'entretiens pour les journalistes montre comment des intervenants nommés rendent les citations rapides à vérifier.

Étiquettes d'intervenants pendant l'enregistrement

Sur Mac, et sur les iPhone dotés de 8 Go de mémoire, vous pouvez activer les Étiquettes des intervenants en direct pour que les noms apparaissent pendant l'enregistrement. Elles sont désactivées par défaut. Sur tous les appareils, la transcription complète et ses étiquettes d'intervenants sont produites après l'arrêt.

Les intervenants connus se synchronisent entre vos appareils

Si Synchroniser entre appareils est activé, les profils d'intervenants accompagnent vos transcriptions via votre propre compte iCloud, fourni par Apple. Nommez un client sur votre iPhone après un café, et l'enregistrement de l'appel vidéo du lendemain sur votre Mac portera son nom. Le guide de synchronisation explique ce qui est inclus.

Questions fréquentes

L'identification des intervenants fonctionne-t-elle hors ligne ?

Oui. Les étiquettes d'intervenants sont produites sur votre iPhone, iPad ou Mac et fonctionnent hors ligne. Les voix enregistrées sont conservées dans ThinkScribe sur votre appareil, et dans votre propre compte iCloud uniquement si vous activez la synchronisation. Elles ne nous sont jamais envoyées.

Combien d'intervenants peut-il distinguer ?

ThinkScribe détecte automatiquement le nombre d'intervenants : vous n'avez pas à l'indiquer à l'avance. La reconnaissance est la plus fiable avec quelques voix habituelles, proches du micro. Dans les grandes tables rondes, les voix rares ou lointaines peuvent rester génériques ou être fusionnées avec quelqu'un d'autre jusqu'à ce que vous les renommiez.

Comment supprimer une voix enregistrée ?

Ouvrez les intervenants connus (Réglages > Identification du locuteur > Gérer les locuteurs connus sur iPhone, Réglages > IA et modèles > Intervenants connus > Gérer… sur Mac) et supprimez la voix. La même liste permet de renommer et de fusionner des voix.

Les profils vocaux sont-ils des enregistrements ?

Un profil vocal est une description numérique compacte d'une voix, que ThinkScribe compare aux nouveaux enregistrements, comme expliqué plus haut. C'est ce qui permet de reconnaître à nouveau une voix enregistrée, et il ne nous est jamais envoyé.