Guide e confronti

Trasformare qualsiasi video in testo, e quando conviene estrarre prima l'audio

Ecco la cosa che ogni tutorial su “come trasformare un video in testo” salta: la traccia video è peso morto. Un modello di trascrizione non guarda nemmeno un fotogramma: sente l’audio e nient’altro. Una registrazione dello schermo da 500 MB può contenere 30 MB di suono vero, e gli altri 470 MB esistono solo per rallentare il tuo caricamento.

Una volta che la vedi così, le strade sensate sono esattamente due, e sceglierne una richiede dieci secondi.

Strada uno: carica direttamente il video

Speecho accetta MP4, MOV e WebM così come sono, fino a quattro ore di girato. La parte che sorprende: l’audio viene estratto nel tuo browser prima che venga caricato qualsiasi cosa. Trascini dentro una registrazione da 2 GB, la tua macchina ne tira fuori la colonna sonora in locale, e verso il server viaggia solo quel piccolo file audio. Il caricamento dura minuti, non l’ora che la dimensione del file lascerebbe temere.

Questo copre quasi ogni caso reale, perché quasi ogni “video” che qualcuno vuole trascrivere è già solo un file sul suo disco:

  • una registrazione Zoom o Teams: è un MP4 nella cartella dei download;
  • un Loom: scaricalo prima da Loom, poi è la stessa cosa;
  • una registrazione di Google Meet: atterra su Drive come MP4;
  • una lezione, un’intervista o un episodio di podcast che qualcuno ti ha mandato in video.

Se il tuo obiettivo è la trascrizione e nient’altro, smetti di leggere qui. Carica il video, fine.

Strada due: estrai prima l’MP3

A volte vuoi l’audio come file, non solo il testo che ci sta dietro. È a questo che serve il nostro estrattore gratuito: gira interamente nel browser, non carica nulla e ti consegna un MP3. Usalo quando:

  • vuoi tenerti l’audio, per un feed podcast, un archivio o per ascoltarlo in giro;
  • il video è enorme e la tua connessione no: un MP3 parlato a 64 kbps di una riunione di un’ora pesa circa 30 MB, e si carica ovunque;
  • la registrazione supera le quattro ore: estrai l’audio e manda quello;
  • userai l’audio in più di un posto: lo trascrivi qui, lo monti altrove.

L’estrattore ha un preset “Parlato” per un motivo preciso: 64 kbps mono è esattamente ciò che serve a un modello vocale. Le voci restano nitide; a rimetterci è solo la musica, e il modello la musica non la stava ascoltando comunque.

Cosa succede dopo, in entrambi i casi

La stessa cosa: trascrizione con OpenAI Whisper in 99 lingue con rilevamento automatico, etichette dei relatori opzionali per interviste e riunioni, un riassunto AI, la traduzione in 18 lingue e l’export in Word o in sottotitoli. Paghi a ora di audio - da $0,83 - senza abbonamento, e registrandoti ottieni 15 minuti gratis per fare la prova con una registrazione tua, non con la demo di qualcun altro.

L’unico caso che nessuna delle due strade copre

Un link non è un file. Se quello che hai è l’URL di uno streaming invece di una registrazione che possiedi, né Speecho né l’estrattore lo accetteranno: accettiamo file di proposito, non collegamenti. Scarica la tua registrazione dalla piattaforma che la ospita (Zoom, Loom e Meet lo permettono tutti) e a quel punto sei di nuovo alla strada uno.

Tutta la decisione è qui: vuoi solo il testo, carica il video; vuoi anche l’audio, o il file è enorme, estrai prima. Entrambe le estremità si provano gratis.

Hai una registrazione da trasformare in testo? Trascrivi il primo file gratis → 15 minuti gratis · i crediti non scadono mai · nessun abbonamento

Continua a leggere

Guide e confronti

ADA Title II e i video del tuo ateneo: cosa chiede la norma, e la data che si è spostata

Le università pubbliche devono sottotitolare i loro video secondo WCAG 2.1 AA. La scadenza è passata al 26 aprile 2027 con una interim final rule. Chi è coinvolto, che cosa conta come sottotitolo, che cosa è escluso e quanto costa davvero la conformità all'ora.

30 ago 2026 · 9 min di lettura
Guide e confronti

Messaggi telefonici professionali: 8 modelli e una voce AI per registrarli

Testi pronti da copiare per il centralino, la segreteria, gli orari di chiusura e il menu IVR, e come trasformarne uno qualsiasi in un MP3 di qualità da studio con una voce AI in circa un minuto.

23 lug 2026 · 6 min di lettura
Guide e confronti

ElevenLabs contro OpenAI TTS: quale voce AI ti serve davvero?

Le voci OpenAI costano meno e coprono più lingue; ElevenLabs suona più verosimile. Ecco un'analisi onesta dei compromessi, e una regola semplice per scegliere il livello.

18 lug 2026 · 6 min di lettura

Trasforma la tua prossima registrazione in testo

Carica audio o video e ottieni trascrizione pulita, sottotitoli, riassunto e traduzione in pochi minuti.

Trascrivi il primo file gratis → 15 minuti gratis · i crediti non scadono mai · nessun abbonamento