Lade eine MP3 hoch und bekomm ein Transkript mit Zeitstempeln und Sprechern. Klick jede Zeile an, um genau zu hören, wo sie gesagt wurde, und exportiere dann.
MP3, WAV, M4A oder OGG · bis zu 30 Minuten
Lade eine Aufnahme hoch, die du transkribieren darfst. Das Transkript gehört dir; das Audio wird nach der Verarbeitung nicht behalten.
Tippe auf eine Zeile, um sie zu hören. Die Zeile unter dem Abspielkopf leuchtet beim Abspielen auf. So wird dein Transkript aussehen.
01—So geht's
Keine Software und nichts, was vorher konvertiert werden muss. Die MP3 geht hinein, wie sie ist, und das Transkript öffnet sich auf einer eigenen Seite, mit dem Player oben und den Export-Buttons dort, wo du sie erwartest.
Zieh eine Datei von bis zu dreißig Minuten hinein. Die Länge wird gelesen, bevor etwas hochgeladen wird, und die Seite sagt dir, ob die heutige Umwandlung gratis ist oder was sie in Credits kostet.
Drück auf Transkribieren. Die Engine hört einmal zu, schreibt jedes Wort mit der Sekunde auf, in der es gesagt wurde, und trennt die Sprecher. Eine Zehn-Minuten-MP3 ist meist in unter einer Minute zurück.
Das Transkript öffnet sich neben einem Player. Klick eine Zeile, um sie zu hören, such nach einer Phrase, benenn die Sprecher um und lade reinen Text, Text mit Zeitstempeln, SRT oder VTT herunter.
Etwa ein Zehntel der Aufnahmelänge. Ein Drei-Minuten-Sprachmemo ist in Sekunden zurück, ein Dreißig-Minuten-Interview in ein paar Minuten. Die Seite zeigt beim Arbeiten einen Timer.
02—Das Format
Eine MP3 ist eine komprimierte Audiodatei, die die Frequenzen weglässt, die ein menschliches Ohr kaum wahrnimmt, und den Rest behält, sodass eine Aufnahme auf etwa ein Zehntel ihrer Größe schrumpft und die Stimme erhalten bleibt. Deshalb ist MP3 die häufigste Datei, die Menschen zu einem MP3-zu-Text-Konverter bringen.
Ein Podcast mit 64 kbps und eine Musikdatei mit 320 kbps klingen sehr verschieden, aber für eine Transkriptions-Engine tragen sie fast dieselben Wörter. Nicht die Kompression kostet Wörter, sondern der Lärm im Raum während der Aufnahme. Erst deutlich unter 32 kbps verschwimmen Konsonanten, und so kleine Dateien sind heute selten.
Die meisten Sprach-MP3s sind mono, und genau das passt für die Transkription. Ein Stereo-Interview mit einer Person pro Kanal geht ebenfalls. Die Engine unterscheidet Sprecher an ihren Stimmen, nicht am Kanal, auf dem sie sitzen, also muss vorher nichts neu gemischt werden.
Der Name der hochgeladenen MP3 wird zum Titel des Transkripts, und jeder Export, den du herunterlädst, trägt ihn ebenfalls. Nenn die Datei vor dem Upload so, dass du sie wiedererkennst, oder benenn das Transkript hinterher mit einem Klick um.
Nein. Eine MP3 muss vor der Transkription nicht zur WAV werden, und eine WAV oder M4A muss nicht zur MP3 werden. Lade hoch, was du hast. Diese Seite erwartet einfach MP3 und nimmt den Rest ebenfalls an.
03—Zeile anklicken
Ein MP3-Podcast ist oft eine Stunde lang, und ein Zitat zu prüfen sollte nicht heißen, einen Fortschrittsbalken hin und her zu ziehen. Hier sind Transkript und Audio eins, auf einer Seite, und jede Zeile kennt die Sekunde, zu der sie gehört.
Während die MP3 läuft, wird die gesprochene Zeile hervorgehoben und im Blick gehalten. Klick eine andere Zeile, und die Wiedergabe springt dorthin. Ein Zitat zu prüfen dauert zwei Sekunden.
Tipp eine Phrase, und das Transkript filtert auf die Zeilen, die sie enthalten. Klick eine an, und du hörst genau diesen Moment.
Jede Zeile trägt die Sekunde, in der sie beginnt, aus der Datei gemessen statt aus der Lesegeschwindigkeit geschätzt, damit ein Zeitstempel in den Shownotes den richtigen Moment trifft.
Zwei Stimmen werden Sprecher 1 und Sprecher 2. Benenn sie einmal um, und jede Zeile und jeder Export ziehen mit.
04—Das bekommst du
Eine Umwandlung erzeugt vier Dateien, alle aus denselben zeitlich verankerten Segmenten, sodass reiner Text, Untertitel und die Version mit Zeitstempeln einander nie widersprechen.
Absätze dort getrennt, wo der Sprecher pausiert oder gewechselt hat, bereit zum Einfügen in Notizen, ein Dokument oder eine E-Mail.
Dieselben Zeilen mit Startzeiten oder als SRT- und VTT-Dateien, die direkt auf eine Videospur passen.
Interviews und Anrufe kommen mit zugeordneten Wortbeiträgen zurück, und du entscheidest, wie die Sprecher heißen.
Jedes Transkript bleibt mit seinem Audio dreißig Tage in deinem Verlauf, sodass du die Seite wieder öffnen, erneut abspielen und später exportieren kannst. Die hochgeladene MP3 wird nirgends sonst behalten, und das Löschen des Transkripts entfernt beides.
05—Woher MP3s kommen
MP3 ist das Format, in dem Dinge heruntergeladen und exportiert werden, und darum kommt so viel Sprache darin an. Das sind die sechs Orte, von denen eine MP3 meist stammt, und was dir das Umwandeln in Text jeweils bringt.
Zitate für die Shownotes ziehen, die Minute finden, in der ein Thema aufkam, und ein Transkript für die veröffentlichen, die lieber lesen als hören.
Interviews und Vorlesungen direkt vom Gerät. Ein Mikrofon nah am Sprecher schlägt ein gutes in der Mitte des Tisches.
Ein Transkript mit Sprechern ist ein Protokoll davon, wer sich wozu verpflichtet hat. Such nach einem Namen oder einer Frist, statt eine Stunde nachzuhören.
Eine aufgezeichnete Stunde wird zu Notizen mit Zeitstempeln, sodass Lernende zur genauen Minute zurückgehen können, in der ein Begriff erklärt wurde.
Ein Interview, das vor zehn Jahren als MP3 gespeichert wurde, transkribiert so gut wie eines von heute. Die Kompression war nie das Problem, sondern der Raum, in dem aufgenommen wurde.
Die Engine ist für gesprochene Stimmen gebaut, nicht für Gesang. Für Songtexte trenn den Song zuerst mit dem Vocal Remover und transkribiere die Gesangsspur allein; das Ergebnis ist deutlich sauberer.
Es transkribiert keine Wörter, die nie hörbar waren, es übersetzt das Audio selbst nicht, und es ist keine Live-Untertitelung. Es arbeitet mit MP3-Dateien, die du bereits hast, bis zu dreißig Minuten pro Datei; teile eine längere an einer natürlichen Pause und wandle sie in zwei Teilen um.
06—Fragen
Ja. Lade die MP3 hoch, drück auf Transkribieren, und das Transkript öffnet sich mit Zeitstempeln und Sprecherlabels. Klick eine Zeile an, um sie zu hören, und lade es dann als Text oder Untertitel herunter.
Jedes angemeldete Konto bekommt täglich drei Gratis-Umwandlungen von je bis zu zehn Minuten, mit jedem Exportformat. Bezahlte Pläne heben das Tageslimit auf, erlauben Dateien bis dreißig Minuten und rechnen pro Minute in Credits ab. Den Satz findest du auf der Preisseite.
Bei einer klaren Aufnahme von ein oder zwei Personen nahe an dem, was ein aufmerksamer Zuhörer mitschreiben würde. Die MP3-Kompression spielt kaum eine Rolle; Hintergrundlärm, entfernte Mikrofone und Menschen, die durcheinanderreden, senken die Genauigkeit. Das Audio zuerst mit dem Voice Isolator zu säubern hilft mehr als alles andere.
In der Praxis nicht. Sprache mit 64 kbps transkribiert so gut wie Sprache mit 320 kbps. Erst Dateien deutlich unter 32 kbps verlieren Konsonanten, und der Abstand zum Mikrofon zählt weit mehr als die Bitrate.
Ja. Jede Zeile trägt ihre Startzeit aus dem Audio, und jeder Wortbeitrag wird einem Sprecher zugeordnet, den du umbenennen kannst. Bei einer Aufnahme mit nur einer Stimme werden die Labels nicht angezeigt.
Die Engine ist für gesprochene Stimmen ausgelegt, ein gemischter Song kommt darum lückenhaft zurück. Trenn den Song zuerst mit dem Vocal Remover und transkribiere die isolierte Gesangsspur; das funktioniert deutlich besser.
Bis zu 50 MB und dreißig Minuten pro Datei. Eine typische einstündige Podcast-MP3 bleibt unter der Größengrenze, also teile sie an einer natürlichen Pause und wandle sie als zwei Dateien um.
Reiner Text, Text mit Zeitstempeln, SRT und VTT. Jeder Export trägt den Namen der hochgeladenen MP3, aus interview.mp3 wird also interview.srt.
07—Mehr Werkzeuge
MP3 ist ein Format unter mehreren, und das Transkript ist ein Skript, sobald es existiert. Der Rest von AnyVoice kümmert sich um beide Enden.
Recorder-, Audacity- und Studiodateien, mit Zeitstempeln transkribiert.
iPhone-Sprachmemos und WhatsApp-Audio, genauso transkribiert.
Eine verrauschte MP3 zuerst säubern, für ein besseres Transkript.
Klone deine Stimme und lass dir das Transkript darin vorlesen.