Precisión y confianza

Clean verbatim vs full verbatim: qué elimina cada nivel y cuál te da realmente la IA

Todos los formularios de pedido de transcripción hacen la misma pregunta, y la mayoría de quienes piden por primera vez responde al azar. «¿Clean verbatim o full verbatim?» suena a un ajuste de calidad. No lo es. Es una decisión sobre qué cuenta como registro: lo que la persona dijo o lo que la persona quería decir. Si te equivocas hacia un lado, pagas por una transcripción que nadie puede leer; si te equivocas hacia el otro, has editado a un testigo sin que nadie lo note.

Aquí están los mismos quince segundos de habla en cada nivel, qué elimina cada uno, quién necesita cuál de verdad y qué tienes realmente entre manos cuando una IA te entrega una transcripción.

Una frase, tres transcripciones

Alguien dice esto en una reunión de planificación:

Full verbatim:

Yo, eh, yo creo que nosotros… nosotros deberíamos, o sea, lanzarlo el martes. [ríe] O, este, el miércoles. El miércoles está bien.

Clean verbatim:

Yo creo que deberíamos lanzarlo el martes. O el miércoles. El miércoles está bien.

Editada (a veces vendida como «intelligent verbatim»):

Creo que deberíamos lanzarlo el martes o el miércoles.

La primera es una grabación en forma de texto. La segunda es lo que el hablante firmaría. La tercera es una paráfrasis: más corta y más suave, y ya no es una cita. Solo las dos primeras son transcripciones.

Qué elimina cada nivel

Las definiciones del sector son lo bastante coherentes como para ponerlas en una tabla. El full verbatim, tal como lo define Rev, significa que «cada palabra pronunciada en tu archivo de audio se escribe palabra por palabra»; el clean verbatim significa que el archivo se ha «editado ligeramente para facilitar la lectura», sin parafrasear. Verificado en septiembre de 2026.

¿Se elimina?Full verbatimClean verbatimEditada
Sonidos de vacilación: eh, em, estese conservase eliminase elimina
Muletillas: o sea, bueno, en planse conservase eliminase elimina
Arranques fallidos: «nosotros… nosotros deberíamos»se conservase eliminase elimina
Tartamudeos y palabras repetidasse conservase eliminase elimina
Autocorrecciones: «el martes. O el miércoles»se conservase conservase fusiona
«Sí», «ajá» de otros hablantesse conservanormalmente se eliminase elimina
No verbal: [ríe], [tose], [pausa]se conserva, etiquetadose eliminase elimina
Jerga y gramáticatal como se dijotal como se dijocorregida
Estructura de la frasetal como se dijotal como se dijoreescrita

Dos filas resuelven la mayoría de las discusiones. Las autocorrecciones se quedan en el clean verbatim: «O el miércoles. El miércoles está bien» es el hablante cambiando de opinión en el registro, y cortarlo cambia el significado. Y la gramática se queda como se dijo: el clean verbatim quita ruido, no corrige el español. En el momento en que una transcripción empieza a corregir la gramática, ha pasado a ser edición y ya no se puede citar entre comillas.

Quién necesita full verbatim, y lo que cuesta

El full verbatim es para cualquiera cuyo análisis dependa de cómo se dijo algo, no solo de qué.

  • Procedimientos legales. Una transcripción de declaración que omite el «eh, yo… yo no recuerdo» de un testigo ha eliminado precisamente la vacilación sobre la que un abogado discutirá después. Los taquígrafos judiciales lo escriben todo por esa razón.
  • Investigación cualitativa que codifica el habla en sí. Análisis de la conversación, análisis del discurso, parte de la psicología y la lingüística: la pausa y el arranque fallido son los datos.
  • Historia oral. Un archivo es una fuente. Limpiarlo es lo mismo que retocar una fotografía en un expediente de pruebas.

El coste es real y se ha medido. Un estudio de 2022 en Emerging Themes in Epidemiology, basado en dos ensayos de salud comunitaria en Ghana, encontró que la transcripción verbatim llevaba de 6 a 10 horas por cada hora de entrevista, frente a 1 o 2 horas para notas ampliadas del entrevistador. Su conclusión no fue «el verbatim siempre es necesario». Fue que, para preguntas aplicadas relativamente simples, las notas bien supervisadas bastaban, y que en los grupos focales, donde la propia interacción llevaba el significado, las notas «no lograron captar la interacción ni la riqueza» y el verbatim seguía siendo necesario. Esa es la forma honesta de la respuesta: verbatim donde la textura es el hallazgo, no en todas partes.

Quién necesita clean verbatim

Casi todos los demás, y es el estándar que la mayoría de los servicios presupuesta.

  • Transcripciones de pódcast y notas del episodio. Nadie lee la página de un pódcast por los «eh».
  • Entrevistas para artículos. Vas a citar de aquí, y el clean verbatim es lo que se supone que es una cita: las palabras del hablante, menos el ruido que el propio hablante quitaría. (Qué se puede cortar dentro de una cita es otra pregunta, con sus propias reglas: la tratamos en qué puedes recortar de una cita.)
  • Notas de reuniones, clases, material de estudio. Lo que importa es el contenido, y cada muletilla es un bache.
  • Subtítulos. Los subtítulos en full verbatim incumplen dos veces la regla de velocidad de lectura: las muletillas se comen caracteres y los arranques fallidos se convierten en sus propios microcues, uno de los fallos de nuestras reglas de tiempos para subtítulos.

Qué es realmente una transcripción con IA

Esta es la parte que los formularios de pedido nunca cuentan, así que aquí va sin rodeos.

La salida bruta de la IA no es ninguna de las dos. Los modelos de voz se entrenan sobre todo con audio subtitulado, y los subtítulos omiten los «eh». Así que los modelos aprendieron a omitirlos también. Una transcripción bruta de cualquier motor moderno conserva la mayoría de las palabras y descarta una proporción impredecible de vacilaciones, tartamudeos y repeticiones: más de lo que el full verbatim permite, menos de lo que el clean verbatim exige. Si una norma legal o de investigación dice «full verbatim», una transcripción con IA sin revisar no la cumple, diga lo que diga la página de marketing. Alguien tiene que cotejarla con el audio.

El clean verbatim es donde la IA es realmente buena, con una condición. Speecho lo hace en dos sitios, y funcionan de forma distinta a propósito.

El contador de muletillas elimina muletillas por lista: un conjunto conocido de sonidos de vacilación y muletillas para cada uno de 12 idiomas, más las que añadas, más las repeticiones inmediatas de palabras. Es gratis, funciona en tu navegador y resalta cada coincidencia antes de eliminar nada, así que ves que el «claro» de «lo tengo claro» está a punto de irse y lo devuelves. No toca los arranques fallidos ni las autocorrecciones, porque una lista de palabras no puede distinguir «nosotros… nosotros deberíamos» de una repetición deliberada.

Dentro de Speecho, el estilo de notas Texto limpio (sin muletillas) hace el trabajo completo con un modelo de lenguaje: muletillas, arranques fallidos, tartamudeos y autocorrecciones inmediatas (conservando la versión corregida), con la puntuación reparada donde las eliminaciones lo exigen. Trabaja párrafo a párrafo y tiene la instrucción de no resumir, acortar, reordenar ni reformular nada más. Esa instrucción es toda la diferencia entre clean verbatim y edición, y por eso el resultado debe leerse una vez antes de publicarlo: un modelo que sigue una regla no es una persona comprobando una cita.

Ninguno de los dos debería producir jamás la tercera columna. Si una herramienta te devuelve frases más cortas y más suaves de las que dijo el hablante, ha editado, no limpiado, y no puedes poner comillas alrededor del resultado.

La regla práctica

Hazte una sola pregunta: ¿alguien tendrá que discutir alguna vez sobre cómo se dijo esto? Si sí, un tribunal, un comité de ética, un historiador del futuro, conserva el full verbatim, trata la transcripción con IA como un borrador y haz que la cotejen con el audio. Si no, el clean verbatim es el registro correcto, y es el que la IA produce bien: transcribe, ejecuta la limpieza, léelo una vez, publica.

En cualquier caso, la transcripción bruta es la que hay que guardar. Un archivo verbatim siempre se puede limpiar. Uno limpio no se puede ensuciar de vuelta.

Compruébalo con tu propio audio Pruébalo con tu peor grabación → 15 minutos gratis · los créditos nunca caducan · sin suscripción

Sigue leyendo

Precisión y confianza

¿Qué precisión tiene la transcripción con IA en 2026? Una respuesta honesta

La transcripción con IA alcanza entre un 90 % y un 97 % de precisión por palabra con audio limpio, pero la cifra real depende de tu grabación. Qué la afecta y cómo acercarte a la perfección.

14 jul 2026 · 8 min de lectura
Precisión y confianza

¿Es seguro subir audio a una herramienta de transcripción?

Las entrevistas, las sesiones de terapia y las reuniones de dirección son sensibles. Aquí tienes lo que de verdad le pasa a tu audio cuando lo transcribes, y las preguntas que hacerle a cualquier herramienta antes de subirlo.

24 jun 2026 · 5 min de lectura
Cómo transcribir

Qué puedes recortar de una cita: la regla de AP, la del Times y dónde encajan las transcripciones con IA

Los libros de estilo de las redacciones coinciden en que puedes quitar los «eh» y discrepan en casi todo lo demás. Qué dicen realmente AP, The New York Times y The Washington Post sobre alterar una cita textual, y por qué una transcripción con IA sin verificar no es una fuente citable.

3 sept 2026 · 6 min de lectura

Convierte tu próxima grabación en texto

Sube audio o vídeo y obtén una transcripción limpia, subtítulos, resumen y traducción en minutos.

Transcribe tu primer archivo gratis → 15 minutos gratis · los créditos nunca caducan · sin suscripción