Clean verbatim ou full verbatim : ce que chaque niveau retire, et lequel l'IA vous donne vraiment
Tous les bons de commande de transcription posent la même question, et la plupart des gens qui commandent pour la première fois répondent au hasard. « Clean verbatim ou full verbatim ? » ressemble à un réglage de qualité. Ce n’en est pas un. C’est une décision sur ce qui fait foi : ce que la personne a dit, ou ce qu’elle voulait dire. Trompez-vous dans un sens et vous payez une transcription que personne ne peut lire ; trompez-vous dans l’autre et vous avez discrètement réécrit un témoin.
Voici les mêmes quinze secondes de parole à chaque niveau, ce que chaque niveau retire, qui a vraiment besoin de quoi, et ce que vous tenez réellement entre les mains quand une IA vous remet une transcription.
Une phrase, trois transcriptions
Quelqu’un dit ceci en réunion de planification :
Full verbatim :
Je, euh, je pense qu’on… qu’on devrait, enfin, livrer mardi. [rit] Ou, euh, mercredi. Mercredi, ça va aussi.
Clean verbatim :
Je pense qu’on devrait livrer mardi. Ou mercredi. Mercredi, ça va aussi.
Éditée (parfois vendue comme « intelligent verbatim ») :
Je pense qu’on devrait livrer mardi ou mercredi.
La première est un enregistrement sous forme de texte. La deuxième est ce que la personne signerait. La troisième est une paraphrase : plus courte, plus lisse, et ce n’est plus une citation. Seules les deux premières sont des transcriptions.
Ce que chaque niveau retire
Les définitions du secteur sont assez cohérentes pour tenir dans un tableau. Le full verbatim, tel que Rev le définit, signifie que « chaque mot prononcé dans votre fichier audio est écrit mot pour mot » ; le clean verbatim signifie que le fichier a été « légèrement édité pour une lecture facile », sans paraphrase. Vérifié en septembre 2026.
| Retiré ? | Full verbatim | Clean verbatim | Éditée |
|---|---|---|---|
| Sons d’hésitation : euh, hum, ben | conservé | retiré | retiré |
| Tics de langage : enfin, du coup, genre | conservé | retiré | retiré |
| Faux départs : « qu’on… qu’on devrait » | conservé | retiré | retiré |
| Bégaiements et répétitions de mots | conservé | retiré | retiré |
| Auto-corrections : « mardi. Ou mercredi » | conservé | conservé | fusionné |
| « Oui », « hm hm » des autres locuteurs | conservé | généralement retiré | retiré |
| Non verbal : [rit], [tousse], [pause] | conservé, balisé | retiré | retiré |
| Argot et grammaire | tel que dit | tel que dit | corrigé |
| Structure des phrases | telle que dite | telle que dite | réécrite |
Deux lignes tranchent la plupart des débats. Les auto-corrections restent en clean verbatim : « Ou mercredi. Mercredi, ça va aussi », c’est la personne qui change d’avis dans le procès-verbal, et le couper change le sens. Et la grammaire reste telle que dite : le clean verbatim retire du bruit, il ne corrige pas le français. Dès qu’une transcription se met à corriger la grammaire, elle est passée du côté de l’édition, et on ne peut plus la mettre entre guillemets.
Qui a besoin du full verbatim, et ce que cela coûte
Le full verbatim s’adresse à tous ceux dont l’analyse dépend de la façon dont une chose a été dite, pas seulement de ce qui a été dit.
- Procédures judiciaires. Un procès-verbal de déposition qui supprime le « euh, je… je ne me souviens pas » d’un témoin a retiré précisément l’hésitation sur laquelle un avocat plaidera plus tard. Les sténographes judiciaires écrivent tout pour exactement cette raison.
- Recherche qualitative qui code la parole elle-même. Analyse conversationnelle, analyse de discours, une partie de la psychologie et de la linguistique : la pause et le faux départ sont les données.
- Histoire orale. Une archive est une source. La nettoyer revient à retoucher une photo dans un dossier de preuves.
Le coût est réel et il a été mesuré. Une étude de 2022 dans Emerging Themes in Epidemiology, tirée de deux essais de santé communautaire au Ghana, a constaté que la transcription verbatim prenait 6 à 10 heures par heure d’entretien, contre 1 à 2 heures pour des notes développées par l’enquêteur. Leur conclusion n’était pas « le verbatim est toujours nécessaire ». C’était que, pour des questions appliquées relativement simples, des notes bien encadrées suffisaient, et que pour les groupes de discussion, où l’interaction elle-même portait le sens, les notes « n’ont pas réussi à capturer l’interaction et la richesse » et le verbatim restait indispensable. C’est la forme honnête de la réponse : le verbatim là où la texture est le résultat, pas partout.
Qui a besoin du clean verbatim
Presque tous les autres, et c’est le standard que la plupart des prestataires proposent par défaut.
- Transcriptions de podcasts et notes d’épisode. Personne ne lit la page d’un podcast pour les « euh ».
- Interviews pour des articles. Vous allez citer ce texte, et le clean verbatim est ce qu’une citation est censée être : les mots de la personne, moins le bruit qu’elle retirerait elle-même. (Ce qu’on a le droit de couper à l’intérieur d’une citation est une autre question, avec ses propres règles : voir ce qu’on peut couper dans une citation.)
- Comptes rendus de réunion, cours, supports de révision. L’important est le contenu, et chaque tic est un ralentisseur.
- Sous-titres. Des sous-titres en full verbatim échouent deux fois à la règle de vitesse de lecture : les tics mangent des caractères, et les faux départs deviennent leurs propres micro-sous-titres, l’un des défauts de nos règles de timing des sous-titres.
Ce qu’est vraiment une transcription par IA
C’est la partie que les bons de commande ne disent jamais, alors la voici sans détour.
La sortie brute d’une IA n’est ni l’un ni l’autre. Les modèles de reconnaissance vocale sont entraînés en grande partie sur de l’audio sous-titré, et les sous-titres omettent les « euh ». Les modèles ont donc appris à les omettre aussi. Une transcription brute de n’importe quel moteur moderne garde la plupart des mots et laisse tomber une part imprévisible des hésitations, bégaiements et répétitions : plus que le full verbatim ne l’autorise, moins que le clean verbatim ne l’exige. Si une norme juridique ou scientifique dit « full verbatim », une transcription IA non relue ne la respecte pas, quoi qu’en dise la page marketing. Quelqu’un doit la vérifier contre l’audio.
Le clean verbatim est le domaine où l’IA est vraiment bonne, à une condition près. Speecho le fait à deux endroits, et ils fonctionnent différemment à dessein.
Le compteur de tics de langage retire les tics par liste : un ensemble connu de sons d’hésitation et de tics pour chacune de 12 langues, plus ceux que vous ajoutez, plus les répétitions immédiates de mots. Il est gratuit, tourne dans votre navigateur et surligne chaque occurrence avant de retirer quoi que ce soit, si bien que vous voyez que le « quoi » de « je ne sais pas quoi » est sur le point de partir, et vous le remettez. Il ne touche ni aux faux départs ni aux auto-corrections, parce qu’une liste de mots ne peut pas distinguer « qu’on… qu’on devrait » d’une répétition volontaire.
Dans Speecho, le style de notes Texte nettoyé (sans tics de langage) fait le travail complet avec un modèle de langage : tics, faux départs, bégaiements et auto-corrections immédiates (en gardant la version corrigée), avec la ponctuation réparée là où les suppressions l’exigent. Il travaille paragraphe par paragraphe et a pour consigne de ne rien résumer, raccourcir, réordonner ni reformuler d’autre. Cette consigne est toute la différence entre clean verbatim et édition, et c’est pourquoi le résultat doit quand même être relu une fois avant publication : un modèle qui suit une règle n’est pas une personne qui vérifie une citation.
Aucun des deux ne doit jamais produire la troisième colonne. Si un outil vous rend des phrases plus courtes et plus lisses que celles prononcées, il a édité, pas nettoyé, et vous ne pouvez pas mettre le résultat entre guillemets.
La règle simple
Posez-vous une seule question : quelqu’un devra-t-il un jour débattre de la façon dont cela a été dit ? Si oui, un tribunal, un comité d’éthique, un futur historien, gardez le full verbatim, traitez la transcription IA comme un brouillon et faites-la vérifier contre l’audio. Si non, le clean verbatim est le bon document, et c’est celui que l’IA produit bien : transcrire, lancer le nettoyage, relire une fois, publier.
Dans tous les cas, c’est la transcription brute qu’il faut conserver. On peut toujours nettoyer un fichier verbatim. On ne peut pas dé-nettoyer un fichier propre.