Ja — CapCut hat eingebautes Text-to-Speech, es ist kostenlos und liegt nur drei Taps von deiner Textebene entfernt. Tipp dein Skript als Textelement ein, wähl es aus, tipp auf Text-to-speech, wähl eine Stimme — fertig.
Damit wäre die Frage beantwortet. Die Geschichte ist damit aber noch nicht zu Ende.
Denn die nächsten drei Fragen kommen sofort: Warum finde ich die Funktion auf meinem Mac nicht?, Darf ich diese Stimme in einem monetarisierten Video nutzen? und Warum klingt meine Narration wie jedes zweite TikTok? CapCuts eigene Hilfeseiten beantworten davon keine einzige richtig — dieser Guide schon.
Das lernst du hier:
- Wo der Text-to-Speech-Button auf Handy, Desktop und Web wirklich sitzt
- Warum die Funktion auf manchen Macs fehlt — und die zwei Auswege
- Der Lizenz-Haken, den fast niemand erwähnt
- Sechs Fixes, wenn „Text-to-Speech nicht funktioniert"
- Wie du eine bessere Stimme importierst, wenn die eingebaute Liste nicht reicht
Hat CapCut Text-to-Speech? (Die kurze Antwort)
CapCut bietet Text-to-Speech auf jeder großen Plattform — aber nicht überall gleich. Funktionsumfang, Stimmenliste und sogar die Existenz des Buttons variieren je nach Plattform, Region und App-Version.
Hier das ehrliche Bild der Verfügbarkeit:
| Plattform | Text-to-Speech? | Wo es sitzt | Hinweise |
|---|---|---|---|
| Handy (iOS/Android) | ✅ Ja | Textebene auswählen → Text-to-speech | Größte Stimmenauswahl |
| Desktop (Windows) | ✅ Ja | Text-Panel → Tab Text to speech | Gut für mehrere Clips |
| Desktop (Mac) | ⚠️ Manchmal | Wie bei Windows — wenn vorhanden | Fehlt in manchen Versionen/Regionen |
| Web (capcut.com) | ✅ Ja | Eigenständiges TTS-Tool | 200+ Stimmen, Lizenzfilter |
Zwei Dinge in dieser Tabelle verdienen Nachdruck.
Erstens: Das Web-Tool ist ein eigenes Produkt, getrennt von der Editor-Funktion. CapCuts Online-TTS-Tool wirbt mit über 200 Stimmen — mehr, als der Editor zeigt — und ist der einzige Ort mit einem expliziten Filter für kommerzielle Lizenzen.
Zweitens: „Manchmal" beim Mac ist kein Tippfehler. Dazu kommen wir gleich.
Text-to-Speech in CapCut auf dem Handy nutzen
In der Mobile-App fühlt sich CapCuts TTS am meisten zu Hause — es ist derselbe Ablauf, den Millionen TikTok-Creator täglich nutzen.
Schritt 1: Textebene hinzufügen
Öffne dein Projekt, tipp in der unteren Toolbar auf Text → Add text (Text hinzufügen) und tipp oder füg dein Skript ein. Gestalte den Text, wie du willst — das Styling hat keinen Einfluss auf die Stimme.
Schritt 2: Ebene auswählen und auf Text-to-speech tippen
Scroll mit ausgewählter Textebene durch die untere Toolbar, bis du Text-to-speech siehst. Tipp drauf.
Wenn du die Option nicht siehst: Tipp zuerst auf die Textebene — der Button erscheint nur, solange ein Textelement ausgewählt ist. Dieses eine Detail steckt hinter den meisten „CapCut hat kein TTS"-Beschwerden.
Schritt 3: Stimme wählen und generieren
Eine Stimmenliste erscheint, gruppiert nach Stil und Sprache. Tipp auf eine Stimme für eine sofortige Vorschau und bestätige. CapCut generiert das Audio und legt es als verknüpften Track auf deine Timeline.
Schritt 4: Entscheiden, was mit dem Text passiert
CapCut fragt, ob der Text auf dem Bildschirm bleiben soll oder nur die Stimme generiert wird. Text behalten liefert dir gratis Untertitel; nur Stimme ist sauberer für Narration über B-Roll.
💡 Profi-Tipp: Generier die Sprachaufnahme bevor du deine Bilder fein schneidest. KI-Narration trifft selten das Tempo, das du dir beim Schreiben vorgestellt hast — Clips auf die Stimme zu trimmen geht viel schneller, als die Stimme immer wieder neu zu generieren, bis sie zu den Clips passt.
Text-to-Speech in CapCut am Desktop nutzen
Der Windows-Ablauf
Die Desktop-Version verlegt die Funktion in den Text-Inspektor:
- Klick auf Text → Add text und gib dein Skript auf der Timeline ein.
- Schau mit ausgewähltem Textclip ins rechte Panel und öffne den Tab Text to speech.
- Wähl eine Stimme, klick auf Generate speech (Sprache generieren) — und unter deinem Text erscheint ein neuer Audioclip.
Für längere Projekte ist der Desktop spürbar besser: Du kannst Textclips duplizieren, jedes Skript einzeln bearbeiten und Stimmen neu generieren, ohne die Handy-Tastatur anzufassen.
Warum du die Funktion auf dem Mac nicht findest
Das ist eine der meistgesuchten Fragen zu CapCut-TTS — und CapCuts Antwort darauf ist im Grunde Schweigen. Die Realität, bestätigt durch Nutzerberichte und Tutorial-Seiten: Manche Mac-Versionen und Regionen zeigen das Text-to-Speech-Panel schlicht nicht an, und CapCut ändert die Verfügbarkeit von Funktionen zwischen Versionen ohne Ankündigung.
Wenn deine Mac-Version keine TTS-Option hat, bleiben dir zwei echte Auswege:
Ausweg 1: CapCuts Web-Tool nutzen
Öffne das Online-Text-to-Speech-Tool im Browser, generier dein Audio dort, lade es herunter und importier es in dein Mac-Projekt. Gleicher Account, gleiches Ökosystem, kein fehlendes Panel.
Ausweg 2: Irgendwo eine MP3 generieren und importieren
Jedes TTS-Tool mit MP3-Export funktioniert — auch unser kostenloses Text-to-Speech, ganz ohne Account. Generieren, herunterladen, in CapCut ziehen. Den Import-Workflow erklären wir im Detail weiter unten — denn er ist auch die Antwort auf ein größeres Problem als die Mac-Verfügbarkeit.
CapCuts Stimmen: was du bekommst — und der Lizenz-Haken
Die Stimmenliste
CapCuts eingebaute Stimmen sind stark auf Kurzvideo-Content getrimmt: energiegeladene Erzähler, Meme-Stimmen, Charakter-Effekte und die vertrauten TikTok-Announcer-Stile. Das ist kein Zufall — CapCut und TikTok gehören zum selben Mutterkonzern, und die Stimmen-DNA ist beiden gemeinsam (unser Guide zu den TikTok-Text-to-Speech-Stimmen kartiert diese Seite der Familie).
Die Auswahl variiert je nach Region und ändert sich ohne Ankündigung. Eine Stimme aus einem drei Monate alten Tutorial existiert in deiner App heute vielleicht nicht mehr. Die Stimmenauswahl in der App ist der einzige verlässliche Katalog.
Als schnelle Orientierung lässt sich die eingebaute Bibliothek grob so aufteilen:
| Stimmentyp | Gut für | Schwach bei |
|---|---|---|
| Social-Erzähler | Tempo von TikTok/Reels/Shorts | Wärme in langen Formaten |
| Meme- & Charakterstimmen | Comedy, Trends | Allem Ernsthaften |
| Männlich/weiblich Standard | Einfache Voiceover | Emotionaler Bandbreite |
| Nicht-englische Stimmen | Regionalem Content | Konsistenz über Sprachen hinweg |
Der Lizenz-Haken bei kommerzieller Nutzung
Und jetzt der Teil, den die meisten Tutorials komplett überspringen.
Im Web-TTS-Tool von CapCut gibt es einen Commercial-License-Filter — damit blendest du nur Stimmen ein, die für kommerzielle Nutzung freigegeben sind. Lies das noch einmal: Der Filter existiert, weil nicht jede Stimme für kommerzielle Projekte freigegeben ist.
Für ein Hobby-Video ist das egal. Für einen monetarisierten YouTube-Kanal, ein Kundenprojekt oder eine Anzeige ist es sehr wichtig:
- Freigegebene Stimmen (Commercial-License-Filter an): nutzbar in Werbung, Produktvideos, Marken-Content.
- Alles andere: rechtliche Grauzone für kommerzielle Arbeit. CapCuts Bedingungen haben sich über die Jahre verschoben — und „war doch gratis in der App" ist keine Lizenzantwort, die ein Kunde akzeptiert.
⚠️ Achtung: Die Stimmenauswahl im Editor zeigt auf Handy und Desktop den Lizenzstatus nicht so an wie das Web-Tool. Wenn ein Projekt Geld verdient: Entweder die Stimme über den Filter des Web-Tools prüfen — oder die Frage ganz umgehen, mit Audio aus einem TTS-Dienst, der kommerzielle Rechte ausdrücklich einräumt, so wie es die Bezahlpläne von AnyVoice tun.
CapCut Text-to-Speech funktioniert nicht? 6 Fixes
Wenn der Button fehlt oder die Generierung scheitert, geh diese Liste der Reihe nach durch — sie ist danach sortiert, wie oft jeder Fix hilft. (Umgekehrtes Problem — ein Vorleser, den du loswerden willst? Das steht in unserem Guide zum Ein- und Ausschalten von Text-to-Speech.)
Fix 1: Erst die Textebene auswählen
Die Option Text-to-speech erscheint nur, solange ein Textelement ausgewählt ist. Tipp auf die Ebene, dann schau noch mal. Das ist Ursache Nummer eins.
Fix 2: App aktualisieren
CapCut verschiebt Funktionen ständig zwischen Versionen. Einer veralteten Version können Stimmen fehlen — oder gleich das ganze Panel.
Fix 3: Region prüfen
Die Verfügbarkeit von Funktionen unterscheidet sich je nach Land. Wenn ein Tutorial eine Option zeigt, die deiner App fehlt, ist die Region der wahrscheinlichste Grund. Das Web-Tool ist der Ausweg.
Fix 4: Skript vereinfachen
Skripte, die vor allem aus Emojis, Symbolen oder nicht unterstützten Zeichen bestehen, können ohne Fehlermeldung scheitern. Probier einen schlichten Satz; wenn der funktioniert, füg dein Skript Stück für Stück wieder ein.
Fix 5: Server abwarten
Die Generierung läuft auf CapCuts Servern. Fehlschläge zu Stoßzeiten ohne Fehlermeldung lösen sich meist innerhalb einer Stunde von selbst.
Fix 6: Außenrum arbeiten
Wenn nichts davon hilft: Hör auf, gegen die App zu kämpfen — generier das Audio extern und importier es. Womit wir beim Workflow wären, der Mac-Lücken, Lizenzzweifel und Qualitätsgrenzen der Stimmen in einem Zug löst.
Bessere Stimmen: Audio extern generieren und importieren
CapCuts eingebaute Stimmen sind auf eine Sache optimiert: nach Social Media zu klingen. Sobald dein Projekt einen Doku-Erzähler, eine warme Kursstimme oder einfach eine Stimme braucht, die dein Publikum nicht schon in zehntausend TikToks gehört hat, ist die eingebaute Liste am Ende.
Die Lösung ist nicht, CapCut zu verlassen — sondern die Stimme vom Editor zu trennen.
Der Import-Workflow in 3 Schritten
Schritt 1: Narration als MP3 generieren
Füg dein komplettes Skript in ein dediziertes TTS-Tool ein und exportier eine einzige Audiodatei. Unser Text-to-Speech-MP3-Generator ist genau für diese Übergabe gebaut — Text eintippen, professionelle Stimme wählen, MP3 herunterladen. Für schnelle Tests funktioniert das Gratis-Tool ohne Account.
Ein praktischer Vorteil gegenüber CapCuts Ebene-für-Ebene-Generierung: Ein dediziertes Tool liest dein ganzes Skript in einem Take, mit gleichmäßigem Tempo — kein Zusammenstückeln von zwölf Mini-Clips.
Schritt 2: Datei in CapCut importieren
- Handy: Audio → Sounds → Tab deine Dateien / Gerät → deine MP3 auswählen.
- Desktop: die Datei direkt ins Medien-Panel oder auf die Timeline ziehen.
Schritt 3: Wie jeden Audiotrack bearbeiten
Schneide an Satzgrenzen, richte deine Cuts an der Stimme aus, senk sie unter Musik ab, leg CapCuts Auto-Untertitel drüber. Importierte Narration ist auf der Timeline ein vollwertiger Track.
💡 Profi-Tipp: Wenn die Untertitel exakt zur Narration passen sollen, lass CapCuts Auto-Untertitel über das importierte Audio laufen, statt dein Skript neu einzutippen — so bekommst du Wort-für-Wort-Timing geschenkt.
Wann die eingebauten Stimmen reichen
Ehrlichkeit gilt in beide Richtungen. Wenn dein Video ein Trend-TikTok ist, bei dem die TTS-Stimme Teil des Witzes ist: Nimm CapCuts eingebaute Stimme — der Wiedererkennungswert ist der Punkt. Der Import-Workflow lohnt seinen Extraschritt, sobald der Content dir gehört: Kurse, Kundenarbeit, YouTube-Erklärvideos, alles Monetarisierte, alles über einer Minute.
CapCut-TTS vs. dediziertes Text-to-Speech-Tool
Der ehrliche Vergleich, Funktion für Funktion:
| CapCut eingebaut | Dediziertes TTS (z. B. AnyVoice) | |
|---|---|---|
| Einstiegspreis | Kostenlos | Gratis-Stufe |
| Stimmen-Bandbreite | Social zuerst | Narration, Werbung, E-Learning, Podcasts |
| Lange Skripte | Eine Ebene nach der anderen | Ganzes Skript, ein Take |
| Kommerzielle Rechte | Je Stimme, Filter nur im Web | Explizit in den Bezahlplänen |
| Deine eigene Stimme | ❌ | ✅ per Voice Cloning |
| Läuft, wenn CapCuts TTS streikt | — | Immer (als MP3 importieren) |
Die letzte Zeile ist die praktische Zusammenfassung dieses ganzen Guides: Eine externe MP3 ist die eine Antwort, die unabhängig von Plattform-Lücken, Regionssperren, Lizenzzweifeln und Server-Schluckauf funktioniert.
Wenn du diese Entscheidung für ein größeres Projekt abwägst: Unser Vergleich Voice Cloning vs. Text-to-Speech zeigt, wann eine generische Stimme reicht und wann du deine eigene willst.
Das Fazit
CapCuts Text-to-Speech ist echt, kostenlos und richtig gut in dem, wofür es gebaut wurde: schnelle Social-Videos im Haus-Sound. Nutz es dort ohne Bedenken.
Für alles andere — Mac-Editoren vor einem fehlenden Panel, monetarisierte Kanäle mit Lizenzbedarf, Skripte länger als eine Caption oder einfach eine Stimme mit mehr Bandbreite — generier das Audio extern und importier es. Der Workflow braucht drei Schritte und räumt jede Einschränkung in einem Zug aus dem Weg.
Generier deine Narration als MP3 — kostenlos, ohne Account. Skript eintippen, professionelle Stimme wählen, herunterladen und in CapCut ablegen. Text-to-Speech-MP3-Generator ausprobieren →
