Van elke video tekst maken - en wanneer je eerst de audio uitpakt
Dit is wat elke handleiding over “video naar tekst” overslaat: het videospoor is dood gewicht. Een transcriptiemodel kijkt naar geen enkel beeldje - het hoort de audio en verder niets. Een schermopname van 500 MB bevat misschien 30 MB echt geluid, en die andere 470 MB bestaan alleen om je upload te vertragen.
Zie je het eenmaal zo, dan zijn er precies twee zinnige routes, en kiezen kost tien seconden.
Route één: upload gewoon de video
Speecho neemt MP4, MOV en WebM rechtstreeks aan, tot vier uur beeldmateriaal. Het deel dat mensen verrast: de audio wordt in je browser uitgepakt vóórdat er iets geüpload wordt. Je sleept er een opname van 2 GB in, je eigen machine haalt daar lokaal het geluidsspoor uit, en alleen dat kleine audiobestand reist naar de server. De upload duurt minuten, niet het uur dat de bestandsgrootte doet vermoeden.
Dat dekt vrijwel elk praktijkgeval, want vrijwel elke “video” die iemand wil laten transcriberen is allang een bestand op zijn schijf:
- een Zoom- of Teams-opname - dat is een MP4 in je downloadmap;
- een Loom - download hem eerst bij Loom, verder hetzelfde;
- een Google Meet-opname - die belandt als MP4 in je Drive;
- een college, interview of podcastaflevering die iemand je als video stuurde.
Is de transcriptie je enige doel, stop dan hier met lezen. Upload de video, klaar.
Route twee: pak eerst de MP3 uit
Soms wil je de audio als bestand, niet alleen de tekst die erachter zit. Daarvoor is onze gratis extractor: hij draait volledig in je browser, er wordt niets geüpload, en je krijgt een MP3. Gebruik hem wanneer:
- je de audio wilt bewaren - voor een podcastfeed, een archief, of om onderweg te luisteren;
- de video enorm is en je verbinding niet - een gesproken MP3 van 64 kbps van een vergadering van een uur is ongeveer 30 MB, en die upload je overal;
- de opname langer is dan vier uur - pak de audio uit en stuur die op;
- je de audio op meer dan één plek gebruikt - hier transcriberen, daar monteren.
De extractor heeft niet voor niets een voorinstelling “Spraak”: 64 kbps mono is precies wat een spraakmodel nodig heeft. Stemmen blijven helder; alleen de muziek lijdt eronder, en naar de muziek luisterde het model toch al niet.
Wat er daarna gebeurt, in beide routes
Hetzelfde: transcriptie met OpenAI Whisper in 99 talen met automatische herkenning, optionele sprekerlabels voor interviews en vergaderingen, een AI-samenvatting, vertaling naar 18 talen, en export naar Word of ondertitels. Je betaalt per uur audio - vanaf $0,83 - zonder abonnement, en bij aanmelden krijg je 15 gratis minuten om het met je eigen opname te testen in plaats van met andermans demo.
Het ene geval dat geen van beide routes dekt
Een link is geen bestand. Heb je een stream-URL in plaats van een opname die je zelf bezit, dan neemt noch Speecho noch de extractor hem aan - we accepteren bewust bestanden, geen links. Download je eigen opname bij het platform dat hem bewaart (Zoom, Loom en Meet bieden dat allemaal), en dan ben je gewoon weer bij route één.
Dat is de hele afweging: wil je alleen de tekst, upload de video; wil je de audio er ook bij, of is het bestand enorm, pak dan eerst uit. Beide kanten zijn gratis te proberen.