CapCut Text to Speech: so vertonst du deine Videos (2026)

12. August 2026

Ja — CapCut hat eingebautes Text-to-Speech, es ist kostenlos und liegt nur drei Taps von deiner Textebene entfernt. Tipp dein Skript als Textelement ein, wähl es aus, tipp auf Text-to-speech, wähl eine Stimme — fertig.

Damit wäre die Frage beantwortet. Die Geschichte ist damit aber noch nicht zu Ende.

Denn die nächsten drei Fragen kommen sofort: Warum finde ich die Funktion auf meinem Mac nicht?, Darf ich diese Stimme in einem monetarisierten Video nutzen? und Warum klingt meine Narration wie jedes zweite TikTok? CapCuts eigene Hilfeseiten beantworten davon keine einzige richtig — dieser Guide schon.

Das lernst du hier:

  • Wo der Text-to-Speech-Button auf Handy, Desktop und Web wirklich sitzt
  • Warum die Funktion auf manchen Macs fehlt — und die zwei Auswege
  • Der Lizenz-Haken, den fast niemand erwähnt
  • Sechs Fixes, wenn „Text-to-Speech nicht funktioniert"
  • Wie du eine bessere Stimme importierst, wenn die eingebaute Liste nicht reicht

Hat CapCut Text-to-Speech? (Die kurze Antwort)

CapCut bietet Text-to-Speech auf jeder großen Plattform — aber nicht überall gleich. Funktionsumfang, Stimmenliste und sogar die Existenz des Buttons variieren je nach Plattform, Region und App-Version.

Hier das ehrliche Bild der Verfügbarkeit:

Wo CapCut Text-to-Speech verfügbar ist, nach Plattform

PlattformText-to-Speech?Wo es sitztHinweise
Handy (iOS/Android)✅ JaTextebene auswählen → Text-to-speechGrößte Stimmenauswahl
Desktop (Windows)✅ JaText-Panel → Tab Text to speechGut für mehrere Clips
Desktop (Mac)⚠️ ManchmalWie bei Windows — wenn vorhandenFehlt in manchen Versionen/Regionen
Web (capcut.com)✅ JaEigenständiges TTS-Tool200+ Stimmen, Lizenzfilter

Zwei Dinge in dieser Tabelle verdienen Nachdruck.

Erstens: Das Web-Tool ist ein eigenes Produkt, getrennt von der Editor-Funktion. CapCuts Online-TTS-Tool wirbt mit über 200 Stimmen — mehr, als der Editor zeigt — und ist der einzige Ort mit einem expliziten Filter für kommerzielle Lizenzen.

Zweitens: „Manchmal" beim Mac ist kein Tippfehler. Dazu kommen wir gleich.

Text-to-Speech in CapCut auf dem Handy nutzen

In der Mobile-App fühlt sich CapCuts TTS am meisten zu Hause — es ist derselbe Ablauf, den Millionen TikTok-Creator täglich nutzen.

Schritt 1: Textebene hinzufügen

Öffne dein Projekt, tipp in der unteren Toolbar auf Text → Add text (Text hinzufügen) und tipp oder füg dein Skript ein. Gestalte den Text, wie du willst — das Styling hat keinen Einfluss auf die Stimme.

Schritt 2: Ebene auswählen und auf Text-to-speech tippen

Scroll mit ausgewählter Textebene durch die untere Toolbar, bis du Text-to-speech siehst. Tipp drauf.

Wenn du die Option nicht siehst: Tipp zuerst auf die Textebene — der Button erscheint nur, solange ein Textelement ausgewählt ist. Dieses eine Detail steckt hinter den meisten „CapCut hat kein TTS"-Beschwerden.

Schritt 3: Stimme wählen und generieren

Eine Stimmenliste erscheint, gruppiert nach Stil und Sprache. Tipp auf eine Stimme für eine sofortige Vorschau und bestätige. CapCut generiert das Audio und legt es als verknüpften Track auf deine Timeline.

Schritt 4: Entscheiden, was mit dem Text passiert

CapCut fragt, ob der Text auf dem Bildschirm bleiben soll oder nur die Stimme generiert wird. Text behalten liefert dir gratis Untertitel; nur Stimme ist sauberer für Narration über B-Roll.

💡 Profi-Tipp: Generier die Sprachaufnahme bevor du deine Bilder fein schneidest. KI-Narration trifft selten das Tempo, das du dir beim Schreiben vorgestellt hast — Clips auf die Stimme zu trimmen geht viel schneller, als die Stimme immer wieder neu zu generieren, bis sie zu den Clips passt.

Text-to-Speech in CapCut am Desktop nutzen

Der Windows-Ablauf

Die Desktop-Version verlegt die Funktion in den Text-Inspektor:

  1. Klick auf Text → Add text und gib dein Skript auf der Timeline ein.
  2. Schau mit ausgewähltem Textclip ins rechte Panel und öffne den Tab Text to speech.
  3. Wähl eine Stimme, klick auf Generate speech (Sprache generieren) — und unter deinem Text erscheint ein neuer Audioclip.

Für längere Projekte ist der Desktop spürbar besser: Du kannst Textclips duplizieren, jedes Skript einzeln bearbeiten und Stimmen neu generieren, ohne die Handy-Tastatur anzufassen.

Warum du die Funktion auf dem Mac nicht findest

Das ist eine der meistgesuchten Fragen zu CapCut-TTS — und CapCuts Antwort darauf ist im Grunde Schweigen. Die Realität, bestätigt durch Nutzerberichte und Tutorial-Seiten: Manche Mac-Versionen und Regionen zeigen das Text-to-Speech-Panel schlicht nicht an, und CapCut ändert die Verfügbarkeit von Funktionen zwischen Versionen ohne Ankündigung.

Wenn deine Mac-Version keine TTS-Option hat, bleiben dir zwei echte Auswege:

Ausweg 1: CapCuts Web-Tool nutzen

Öffne das Online-Text-to-Speech-Tool im Browser, generier dein Audio dort, lade es herunter und importier es in dein Mac-Projekt. Gleicher Account, gleiches Ökosystem, kein fehlendes Panel.

Ausweg 2: Irgendwo eine MP3 generieren und importieren

Jedes TTS-Tool mit MP3-Export funktioniert — auch unser kostenloses Text-to-Speech, ganz ohne Account. Generieren, herunterladen, in CapCut ziehen. Den Import-Workflow erklären wir im Detail weiter unten — denn er ist auch die Antwort auf ein größeres Problem als die Mac-Verfügbarkeit.

CapCuts Stimmen: was du bekommst — und der Lizenz-Haken

Die Stimmenliste

CapCuts eingebaute Stimmen sind stark auf Kurzvideo-Content getrimmt: energiegeladene Erzähler, Meme-Stimmen, Charakter-Effekte und die vertrauten TikTok-Announcer-Stile. Das ist kein Zufall — CapCut und TikTok gehören zum selben Mutterkonzern, und die Stimmen-DNA ist beiden gemeinsam (unser Guide zu den TikTok-Text-to-Speech-Stimmen kartiert diese Seite der Familie).

Die Auswahl variiert je nach Region und ändert sich ohne Ankündigung. Eine Stimme aus einem drei Monate alten Tutorial existiert in deiner App heute vielleicht nicht mehr. Die Stimmenauswahl in der App ist der einzige verlässliche Katalog.

Als schnelle Orientierung lässt sich die eingebaute Bibliothek grob so aufteilen:

StimmentypGut fürSchwach bei
Social-ErzählerTempo von TikTok/Reels/ShortsWärme in langen Formaten
Meme- & CharakterstimmenComedy, TrendsAllem Ernsthaften
Männlich/weiblich StandardEinfache VoiceoverEmotionaler Bandbreite
Nicht-englische StimmenRegionalem ContentKonsistenz über Sprachen hinweg

Der Lizenz-Haken bei kommerzieller Nutzung

Und jetzt der Teil, den die meisten Tutorials komplett überspringen.

Im Web-TTS-Tool von CapCut gibt es einen Commercial-License-Filter — damit blendest du nur Stimmen ein, die für kommerzielle Nutzung freigegeben sind. Lies das noch einmal: Der Filter existiert, weil nicht jede Stimme für kommerzielle Projekte freigegeben ist.

CapCut-Stimmenlizenzen: was der Commercial-License-Filter wirklich bedeutet

Für ein Hobby-Video ist das egal. Für einen monetarisierten YouTube-Kanal, ein Kundenprojekt oder eine Anzeige ist es sehr wichtig:

  • Freigegebene Stimmen (Commercial-License-Filter an): nutzbar in Werbung, Produktvideos, Marken-Content.
  • Alles andere: rechtliche Grauzone für kommerzielle Arbeit. CapCuts Bedingungen haben sich über die Jahre verschoben — und „war doch gratis in der App" ist keine Lizenzantwort, die ein Kunde akzeptiert.

⚠️ Achtung: Die Stimmenauswahl im Editor zeigt auf Handy und Desktop den Lizenzstatus nicht so an wie das Web-Tool. Wenn ein Projekt Geld verdient: Entweder die Stimme über den Filter des Web-Tools prüfen — oder die Frage ganz umgehen, mit Audio aus einem TTS-Dienst, der kommerzielle Rechte ausdrücklich einräumt, so wie es die Bezahlpläne von AnyVoice tun.

CapCut Text-to-Speech funktioniert nicht? 6 Fixes

Wenn der Button fehlt oder die Generierung scheitert, geh diese Liste der Reihe nach durch — sie ist danach sortiert, wie oft jeder Fix hilft. (Umgekehrtes Problem — ein Vorleser, den du loswerden willst? Das steht in unserem Guide zum Ein- und Ausschalten von Text-to-Speech.)

Sechs Fixes, wenn CapCut Text-to-Speech nicht funktioniert, der Reihe nach

Fix 1: Erst die Textebene auswählen

Die Option Text-to-speech erscheint nur, solange ein Textelement ausgewählt ist. Tipp auf die Ebene, dann schau noch mal. Das ist Ursache Nummer eins.

Fix 2: App aktualisieren

CapCut verschiebt Funktionen ständig zwischen Versionen. Einer veralteten Version können Stimmen fehlen — oder gleich das ganze Panel.

Fix 3: Region prüfen

Die Verfügbarkeit von Funktionen unterscheidet sich je nach Land. Wenn ein Tutorial eine Option zeigt, die deiner App fehlt, ist die Region der wahrscheinlichste Grund. Das Web-Tool ist der Ausweg.

Fix 4: Skript vereinfachen

Skripte, die vor allem aus Emojis, Symbolen oder nicht unterstützten Zeichen bestehen, können ohne Fehlermeldung scheitern. Probier einen schlichten Satz; wenn der funktioniert, füg dein Skript Stück für Stück wieder ein.

Fix 5: Server abwarten

Die Generierung läuft auf CapCuts Servern. Fehlschläge zu Stoßzeiten ohne Fehlermeldung lösen sich meist innerhalb einer Stunde von selbst.

Fix 6: Außenrum arbeiten

Wenn nichts davon hilft: Hör auf, gegen die App zu kämpfen — generier das Audio extern und importier es. Womit wir beim Workflow wären, der Mac-Lücken, Lizenzzweifel und Qualitätsgrenzen der Stimmen in einem Zug löst.

Bessere Stimmen: Audio extern generieren und importieren

CapCuts eingebaute Stimmen sind auf eine Sache optimiert: nach Social Media zu klingen. Sobald dein Projekt einen Doku-Erzähler, eine warme Kursstimme oder einfach eine Stimme braucht, die dein Publikum nicht schon in zehntausend TikToks gehört hat, ist die eingebaute Liste am Ende.

Die Lösung ist nicht, CapCut zu verlassen — sondern die Stimme vom Editor zu trennen.

Der Import-Workflow in 3 Schritten

In AnyVoice eine MP3 generieren und in drei Schritten in CapCut importieren

Schritt 1: Narration als MP3 generieren

Füg dein komplettes Skript in ein dediziertes TTS-Tool ein und exportier eine einzige Audiodatei. Unser Text-to-Speech-MP3-Generator ist genau für diese Übergabe gebaut — Text eintippen, professionelle Stimme wählen, MP3 herunterladen. Für schnelle Tests funktioniert das Gratis-Tool ohne Account.

Ein praktischer Vorteil gegenüber CapCuts Ebene-für-Ebene-Generierung: Ein dediziertes Tool liest dein ganzes Skript in einem Take, mit gleichmäßigem Tempo — kein Zusammenstückeln von zwölf Mini-Clips.

Schritt 2: Datei in CapCut importieren

  • Handy: Audio → Sounds → Tab deine Dateien / Gerät → deine MP3 auswählen.
  • Desktop: die Datei direkt ins Medien-Panel oder auf die Timeline ziehen.

Schritt 3: Wie jeden Audiotrack bearbeiten

Schneide an Satzgrenzen, richte deine Cuts an der Stimme aus, senk sie unter Musik ab, leg CapCuts Auto-Untertitel drüber. Importierte Narration ist auf der Timeline ein vollwertiger Track.

💡 Profi-Tipp: Wenn die Untertitel exakt zur Narration passen sollen, lass CapCuts Auto-Untertitel über das importierte Audio laufen, statt dein Skript neu einzutippen — so bekommst du Wort-für-Wort-Timing geschenkt.

Wann die eingebauten Stimmen reichen

Ehrlichkeit gilt in beide Richtungen. Wenn dein Video ein Trend-TikTok ist, bei dem die TTS-Stimme Teil des Witzes ist: Nimm CapCuts eingebaute Stimme — der Wiedererkennungswert ist der Punkt. Der Import-Workflow lohnt seinen Extraschritt, sobald der Content dir gehört: Kurse, Kundenarbeit, YouTube-Erklärvideos, alles Monetarisierte, alles über einer Minute.

CapCut-TTS vs. dediziertes Text-to-Speech-Tool

Der ehrliche Vergleich, Funktion für Funktion:

CapCut eingebautDediziertes TTS (z. B. AnyVoice)
EinstiegspreisKostenlosGratis-Stufe
Stimmen-BandbreiteSocial zuerstNarration, Werbung, E-Learning, Podcasts
Lange SkripteEine Ebene nach der anderenGanzes Skript, ein Take
Kommerzielle RechteJe Stimme, Filter nur im WebExplizit in den Bezahlplänen
Deine eigene Stimme✅ per Voice Cloning
Läuft, wenn CapCuts TTS streiktImmer (als MP3 importieren)

Die letzte Zeile ist die praktische Zusammenfassung dieses ganzen Guides: Eine externe MP3 ist die eine Antwort, die unabhängig von Plattform-Lücken, Regionssperren, Lizenzzweifeln und Server-Schluckauf funktioniert.

Wenn du diese Entscheidung für ein größeres Projekt abwägst: Unser Vergleich Voice Cloning vs. Text-to-Speech zeigt, wann eine generische Stimme reicht und wann du deine eigene willst.

Das Fazit

CapCuts Text-to-Speech ist echt, kostenlos und richtig gut in dem, wofür es gebaut wurde: schnelle Social-Videos im Haus-Sound. Nutz es dort ohne Bedenken.

Für alles andere — Mac-Editoren vor einem fehlenden Panel, monetarisierte Kanäle mit Lizenzbedarf, Skripte länger als eine Caption oder einfach eine Stimme mit mehr Bandbreite — generier das Audio extern und importier es. Der Workflow braucht drei Schritte und räumt jede Einschränkung in einem Zug aus dem Weg.

Generier deine Narration als MP3 — kostenlos, ohne Account. Skript eintippen, professionelle Stimme wählen, herunterladen und in CapCut ablegen. Text-to-Speech-MP3-Generator ausprobieren →

AnyVoice-Team

AnyVoice-Team