Speech to Text
Anmelden

KI Speech to Text

Lade hoch oder nimm auf, bekomm ein Transkript mit Zeitstempeln und Sprecherlabels und klick jede Zeile an, um genau zu hören, wo sie gesagt wurde.

MP3, WAV, M4A oder OGG · bis zu 30 Minuten

Zeitstempel + SprecherHeute 3 Gratis-Transkriptionen

Lade eine Aufnahme hoch, die du transkribieren darfst. Das Transkript gehört dir; das Audio wird nach der Verarbeitung nicht behalten.

Speech to Text3 gratis pro Tag, je bis zu 10 Minuten. Bezahlte Pläne: 300 Credits pro Minute, bis zu 30 Minuten.
0:00 / 0:33

Tippe auf eine Zeile, um sie zu hören. Die Zeile unter dem Abspielkopf leuchtet beim Abspielen auf. So wird dein Transkript aussehen.

01So geht's

Sprache in Text umwandeln in 3 Schritten

Alles läuft im Browser: keine Diktiersoftware, kein Editor-Plugin, kein Kopieren zwischen Apps. Hochladen, kurz warten, lesen. Das Transkript erscheint nicht unter dem Button, sondern auf einer eigenen Seite, mit dem Player oben und den Export-Buttons dort, wo du sie erwartest.

  1. 1

    Hochladen oder aufnehmen

    Zieh eine MP3, WAV, M4A oder OGG von bis zu dreißig Minuten hinein oder drück auf Aufnehmen und sprich. Die Länge erscheint, bevor etwas hochgeladen wird, dazu die Kosten oder der Hinweis, dass die heutige Transkription gratis ist.

  2. 2

    Transkribieren

    Drück auf Transkribieren. Die Speech-to-Text-Engine hört einmal zu, schreibt jedes Wort mit seinem Zeitpunkt auf und erkennt, wer spricht. Eine Zehn-Minuten-Aufnahme ist meist in unter einer Minute zurück.

  3. 3

    Lesen, klicken, exportieren

    Das Transkript öffnet sich auf einer eigenen Seite mit dem Player oben. Klick eine Zeile, um sie zu hören, such nach einer Phrase, benenn die Sprecher um und lade reinen Text, Text mit Zeitstempeln, SRT oder VTT herunter.

Was du vorher brauchst

Eine Aufnahme, in der Menschen sprechen, und ein Konto. Sonst nichts. Das Gratis-Kontingent deckt drei Transkriptionen pro Tag von je bis zu zehn Minuten ab, also die meisten Interviews, Memos und Vorlesungsabschnitte.

02Die Grundlagen

Was ist Speech to Text?

Speech to Text ist die Umwandlung gesprochener Sprache in geschriebene Wörter durch Software. Modernes Speech to Text hört eine ganze Aufnahme, schreibt jedes Wort mit dem Moment auf, in dem es gesagt wurde, und kann einen Sprecher vom anderen unterscheiden, sodass das Ergebnis ein zeitlich verankertes Transkript ist und keine Textwand.

Speech to Text vs. Diktieren

Diktieren am Handy oder im Dokument passiert live: Du sprichst, es tippt, und es sieht den Satz nie als Ganzes. Eine Transkription der Aufnahme sieht alles auf einmal, setzt darum die Zeichensetzung richtig, löst ein Wort aus den Wörtern drumherum auf und hängt an jede Zeile einen Zeitstempel. Deshalb kann sie auch Sprecher unterscheiden, denn sie hört das ganze Gespräch, bevor sie etwas beschriftet.

Woher die Wörter kommen

Die Engine arbeitet mit dem, was das Mikrofon eingefangen hat. Hintergrundmusik, Wind und Raumhall kosten Genauigkeit. Ist die Aufnahme rau, schick sie zuerst durch den Voice Isolator und transkribiere die saubere Version.

Welches Werkzeug brauchst du?

Willst du durch Sprechen tippen, nimm das Diktieren deines Handys oder deiner Textverarbeitung. Hast du eine Aufnahme und willst die Wörter mit Zeit und Sprechern heraus, ist diese Seite das richtige Werkzeug.

03Zeile anklicken

Klick jede Zeile an, um sie zu hören

Die meisten Transkriptionswerkzeuge geben dir einen Textblock und lassen dich durchs Audio spulen, um ein Wort zu prüfen. Hier sind Transkript und Player eins, auf einer Seite, und jede Zeile kennt die Sekunde, zu der sie gehört.

Das Transkript folgt dem Audio

Während die Aufnahme läuft, leuchtet die gerade gesprochene Zeile auf und die Liste hält sie im Blick. Klick eine andere Zeile, und die Wiedergabe springt dorthin. Ein falsch klingendes Wort ist in zwei Sekunden geprüft, nicht gesucht.

Suchen, dann hören

Tipp eine Phrase, und das Transkript filtert auf die Zeilen, die sie enthalten, mit hervorgehobenem Treffer. Klick eine an, und du hörst genau diesen Moment.

Zeitstempel, denen du trauen kannst

Jede Zeile trägt die Sekunde, in der sie beginnt, aus dem Audio selbst statt aus der Lesegeschwindigkeit geschätzt, damit ein Zeitstempel in den Shownotes den richtigen Moment trifft.

Sprecher, von dir benannt

Zwei Personen werden Sprecher 1 und Sprecher 2. Benenn sie einmal um, und jede Zeile im Transkript und in jedem Export zieht mit.

04Das bekommst du

Das bekommst du von Speech to Text

Eine Transkription, vier Dateien, alle aus denselben zeitlich verankerten Segmenten gebaut.

Reiner Text

Absätze dort getrennt, wo der Sprecher pausiert oder gewechselt hat, mit erhaltenen Füllwörtern, damit das Transkript noch nach der Person klingt. Füg ihn in Notizen, ein Dokument oder eine E-Mail ein oder gib ihn direkt an Text to Speech.

Text mit Zeitstempeln und Untertitel

Dieselben Zeilen mit ihren Startzeiten oder als SRT- und VTT-Dateien, die direkt auf eine Videospur passen.

Sprecherlabels

Interviews und Anrufe kommen mit zugeordneten Wortbeiträgen zurück. Benenn Sprecher 1 nach der Person, und die Labels folgen.

Wo das Transkript liegt

Jede Transkription bleibt mit ihrem Audio dreißig Tage in deinem Verlauf, sodass du die Seite wieder öffnen, erneut abspielen und später exportieren kannst. Die hochgeladene Datei wird nirgends sonst behalten, und ein gelöschtes Transkript verschwindet aus Verlauf und Speicher.

05Anwendungsfälle

Was Menschen transkribieren

Transkription lohnt sich überall dort, wo etwas einmal gesagt wurde und viele Male gelesen werden muss. Das sind die sechs häufigsten Aufgaben und was Zeitstempel und Sprecherlabels jeweils hinzufügen.

Podcast-Folgen

Zitate für die Shownotes ziehen, den Moment finden, in dem ein Thema aufkam, und ein Transkript für die veröffentlichen, die lieber lesen als hören.

Interviews und Anrufe

Jede Antwort schriftlich mit zugeordnetem Sprecher, und mit einem Klick zurück zur Aufnahme, wenn ein Zitat geprüft werden muss.

Vorlesungen und Kurse

Aus einer aufgezeichneten Stunde werden Notizen mit Zeitstempeln, sodass Lernende zur genauen Minute zurückgehen können, in der ein Begriff erklärt wurde.

Meetings

Ein Transkript mit Sprechern ist ein Protokoll davon, wer sich wozu verpflichtet hat. Such nach einem Namen oder einer Frist, statt eine Stunde nachzuhören.

Untertitel

Exportiere SRT oder VTT, und dein Video ist untertitelt, ohne gegen die Uhr zu tippen.

Ein Skript für deine eigene Stimme

Ein Transkript ist ein Skript. Schick es an Text to Speech oder klone deine Stimme und lass dir die Wörter darin vorlesen, neu aufgenommen ohne Mikrofon.

Was es nicht kann

Es transkribiert keine Wörter, die nie hörbar waren, es übersetzt nicht, und es ist kein Live-Untertiteldienst. Es arbeitet mit Aufnahmen, die du bereits hast, bis zu dreißig Minuten am Stück; eine längere Aufnahme teilst du am besten an einer natürlichen Pause und transkribierst sie in zwei Teilen.

06Vergleich

Speech to Text vs. Diktieren vs. Meeting-Assistent

Drei Produktarten hören auf die Wörter Speech to Text, und alle drei lösen verschiedene Probleme.

Speech to Text (dieses Werkzeug)DiktierenMeeting-Assistent
EingabeEine Aufnahme, die du hastDeine Stimme liveEin Live-Anruf, dem er beitritt
Zeitstempel
Sprecherlabels
Zeile anklicken und hörenManchmal
Funktioniert mit jeder Datei
In deiner Stimme vorlesen lassen

Willst du durch Sprechen tippen, diktiere. Willst du einen Bot in deinen Meetings, nimm einen Assistenten. Hast du eine Aufnahme und willst die Wörter heraus, mit dem Audio einen Klick entfernt, nimm diese Seite.

07Best Practice

Ein genaues Transkript bekommen

Die Engine macht die Arbeit, aber was du ihr gibst, entscheidet, wie viele Wörter du hinterher korrigierst. Drei Gewohnheiten decken den größten Teil des Unterschieds zwischen zehn Minuten und zehn Sekunden Korrektur ab.

Die eine größte Verbesserung

Lärm. Eine Aufnahme mit Verkehr, Musik oder einem Lüfter dahinter verliert Wörter, die eine saubere behält. Schick raues Audio zuerst durch den Voice Isolator; das dauert etwa eine Minute, und das Transkript ist sichtbar sauberer.

Ein Mikrofon, nah dran

Ein Handy auf dem Tisch zwischen vier Personen nimmt den Raum auf, nicht die Personen. Näher ist besser als lauter, und ein Mikrofon pro Sprecher ist besser als ein gutes in der Mitte.

Sprecher ausreden lassen

Überlappendes Reden ist der schwerste Fall für jede Transkriptions-Engine. Aufnahmen, in denen sich Leute abwechseln, kommen sauber zurück; eine hitzige Runde braucht überall dort einen zweiten Blick, wo zwei Stimmen auf derselben Sekunde landen.

Mit Namen rechnen

Ungewöhnliche Namen und Produktbegriffe sind die Stellen, an denen Transkripte rutschen. Such sie hinterher und korrigiere sie einmal in deinem Dokument.

08Fragen

Häufig gestellte Fragen

Ist das Speech-to-Text-Werkzeug gratis?

Jedes angemeldete Konto bekommt täglich drei Gratis-Transkriptionen von je bis zu zehn Minuten, mit allen Exportformaten. Bezahlte Pläne heben das Tageslimit auf, erlauben Dateien bis dreißig Minuten und rechnen pro Minute in Credits ab. Den Satz findest du auf der Preisseite.

Brauche ich ein Konto?

Ja. Transkripte bleiben mit ihrem Audio in deinem Verlauf, damit du zu ihnen zurückkommen kannst, und das Gratis-Kontingent wird pro Konto gezählt.

Welche Sprachen werden unterstützt?

Aufnahmen in den meisten verbreiteten Sprachen werden in ihrer eigenen Sprache transkribiert. Die Sprache wird automatisch erkannt; du musst sie nicht einstellen.

Werden Sprecher beschriftet?

Ja. Jeder Wortbeitrag wird einem Sprecher zugeordnet, und du kannst Sprecher 1 und Sprecher 2 in echte Namen umbenennen. Bei einer Aufnahme mit nur einer Stimme werden die Labels einfach nicht angezeigt.

Welche Formate und Längen werden unterstützt?

MP3, WAV, M4A und OGG, bis zu 50 MB und dreißig Minuten pro Datei. Exportiert wird als reiner Text, Text mit Zeitstempeln, SRT und VTT.

Wie genau ist es?

Bei einer klaren Aufnahme von ein oder zwei Personen nahe an dem, was ein aufmerksamer Zuhörer mitschreiben würde. Die Genauigkeit sinkt bei Hintergrundlärm, entfernten Mikrofonen und Menschen, die durcheinanderreden. Das Audio vorher zu säubern hilft mehr als alles andere, und hinterher im Transkript nach Namen zu suchen fängt das meiste Übrige ab.

Kann ich ein Video transkribieren?

Noch nicht direkt. Exportiere die Tonspur des Videos als MP3 oder WAV, lade sie hoch und nutze den SRT-Export, um das Video zu untertiteln.

Ist das dasselbe wie Voice to Text auf meinem Handy?

Nein. Voice to Text auf dem Handy tippt, während du sprichst, und funktioniert nur live. Hier wird eine Aufnahme transkribiert, die du bereits hast, mit Zeitstempeln und Sprecherlabels, und du kannst jede Zeile anklicken, um sie zu hören.

KI Speech to Text — Audio mit Zeitstempeln & Sprechern transkribieren