TikTok 文字转语音全指南:声音名称、用法与更多选择

2026/08/12

每次刷视频都会碰到它:那个明亮、略显过分欢快的声音,正在一条日常 vlog 上朗读字幕。TikTok 的文字转语音(TTS)不只是一个功能——它已经是这个平台声音的一部分。

这篇指南回答大家真正在搜的三个问题:怎么打开它这些声音叫什么(包括所有人都在问的那一个),以及创作者是怎么用上 TikTok 没有的声音的

这篇文章你会学到:

  • 20 秒上手教程(以及为什么这个选项藏在文字贴纸里)
  • “Jessie”声音背后的真人——以及导致换声的那场诉讼
  • 关于“中文口音声音”的一个诚实回答
  • TTS 不显示时的修复方法,以及突破内置十个声音的工作流

TikTok 上怎么用文字转语音

在 TikTok 上添加文字转语音的四个步骤

这个功能的位置有点反直觉——它挂在文字上,而不是在音频工具里:

  1. 录制或上传视频,点击对勾进入编辑页面。
  2. 点击 Text(文字),输入你的字幕。
  3. 点击文字贴纸本身,在弹出菜单中选择 Text-to-speech(文字转语音)。
  4. 从列表中挑选一个声音——点一下即可试听——然后确认。

语音会一字不差地朗读贴纸上的内容,并与贴纸在画面上出现的时间同步。三个教程里通常不讲的实用细节:

  • 时长 = 贴纸时长。 裁剪文字贴纸的时间轴,就能控制语音什么时候开口。
  • 多个贴纸,多次朗读。 每个文字元素都会单独生成一次 TTS——创作者就是这样做出一来一往的“对话”的。
  • 拼写即发音。 声音会照你打的字念,错别字也不放过。故意拼错(比如“gorls”)正是创作者引导它发音的方法。

这些声音都叫什么

Jessie:TikTok 之声

默认女声——大家说“TikTok 那个声音”时指的就是她——被社区命名为 Jessie,而她是一个真人:加拿大电台主持人 Kat Callaghan

这段背景故事的意义远不止冷知识:最初的北美女声在 2021 年被替换,原因是配音演员 Bev Standing 起诉 TikTok 母公司未经授权使用她的声音。案件以和解告终,声音随之更换,而它至今仍是声音权益走进现实法律最清晰的早期案例之一——正是这股潮流催生了今天的授权规则,我们在 AI 声音克隆法律指南里持续跟踪。

其余阵容

TikTok 在任一时期轮换着大约 十个英文声音,另外还有其他市场的地区性声音。社区给它们起的名字(TikTok 官方几乎不标注)可以归为几个家族:

TikTok 文字转语音声音家族一览

家族听起来像什么典型用途
Jessie / 默认女声温暖、欢快、电台级打磨Vlog、故事分享,万能款
标准男声平稳、像新闻播报讲解类、POV 视频
角色声幽灵、花栗鼠式的变调玩法搞笑、短剧
演唱声把你的文字唱出来热门趋势、梗视频
地区性声音英式及其他市场的口音本地化内容

两条经验之谈:这份阵容会在不发公告的情况下变动(半年前教程里的声音可能已经消失),而且可用性因地区而异——你在爆款视频里听到的某个声音,在你所在国家的 App 里可能根本不存在。

创作者真正在用的六个 TTS 技巧

功能本身只要点四下;功夫全在人们怎么把它玩出花样。

1. 为耳朵拼写,而不是为眼睛

声音会严格照打出来的字发音,所以创作者用刻意的拼写错误来引导它——拉长元音以加强语气、把它读错的名字按发音重拼,或者干脆顺着某个错误发音,把它玩成梗。

2. 标点就是节奏

句号换来停顿,逗号换来更短的停顿,一串省略号能让声音在揭晓前吊足胃口。改写一句话的标点,是不动剪辑就能修正喜剧节奏的最快方法。

3. 多贴纸对话

两个文字贴纸、两个声音、交替出现的画面时机——“两个声音在吵架”类视频的全部机制就是这样。每个贴纸都保持简短,对话才有爆发力。

4. 面无表情的反差

最经久不衰的 TTS 笑点格式:一个无比欢快的声音,朗读极其平淡或极其丧的文字。反差本身就是笑点,这也是为什么在这种玩法里,默认声音比“更搞笑”的角色声效果更好。

5. 藏起文字,留下声音

生成之后,在你想要旁白但不想要画面文字的时段,把贴纸缩小并拖出画面(或压到另一个元素下面)。音频保留,字幕消失。

6. TTS 当钩子,真人做主体

口播视频的一种常见结构:先由 TTS 朗读第一句——这是每个刷视频的人都认得的“模式打断”——然后切换到创作者的真实声音。熟悉的声音引人进门,真人的连接留住观众。

TTS 会帮助还是拖累流量?

坦白说:没有任何可信证据表明算法会偏爱或惩罚 TTS 本身。可量化带来帮助的,是 TTS 所促成的东西——有字幕、静音也能看懂、开头钩子清晰的视频。把这个声音当作无障碍与留存工具,而不是排名外挂。

“那个口音声音叫什么?”——一个诚实的回答

TikTok TTS 被搜得最多的问题之一,是梗视频里那个带中文口音的声音。诚实的回答,任何清单文章都不会告诉你:

TikTok 没有官方命名的口音声音。 它的声音列表没有标签、因地区而异且不断轮换。爆款视频里带口音的声音,通常是以下三种之一:

  1. 另一个市场 App 里的地区性 TTS 声音,导出后被反复使用。
  2. 外部工具的声音,在站外生成后作为音频添加。
  3. 一段热门音频——别人的原创声音,被成千上万次复用。

可靠的辨认方法:点击视频上旋转的唱片 / 声音名称。如果是复用的声音,你能看到它的来源。如果是合成进视频的 TTS,它无法被提取——但可以被重现:外部 TTS 声音库里有各种带口音的英文声音(包括带普通话口音的英语),能让你用一个真正获得授权的声音做出同样的效果。

⚠️ 注意: 重现某个特定真人的声音,和使用一个带口音的素材库声音是两回事——前者永远需要本人授权。上文提到的 Bev Standing 诉讼,正是这条界线存在的意义。

别搞混:TTS 与 TikTok 的声音特效

TikTok 有两个不同的功能都被叫作“那个声音功能”,把它们混为一谈,会让人在错误的菜单里翻半天:

  • **文字转语音(Text-to-speech)**根据输入的文字生成一个全新的声音。它挂在文字贴纸上。
  • **声音特效(Voice effects)**对你录下的声音进行变形——花栗鼠、低沉、机器人、回声。它们位于编辑页面的 Audio editing / Voice effects(音频编辑 / 声音特效)图标下,且只对 App 内录制的音频有效。

判断方法:如果视频里的旁白没有人打过字,那就是声音特效(或导入的音轨),而不是 TTS。而如果你真正想要的是第三种东西——让你的录音用一个不同但真实的声音来演绎,而不是变调搞笑——那就是 AI 变声器的活儿,它可以处理任意音频文件,而不局限于 App 内的录音。

图文模式下 TTS 能用吗?

能——图文模式帖子里的文字贴纸同样支持文字转语音,它已经成了幻灯片故事分享的标配。规则不变:语音跟随每张图片上的贴纸。

顺便说说其他语言

输入非英文文字,英文声音会按发音硬念——通常念得很糟。TikTok 是按地区提供不同的声音集,而不是一个多语言声音,所以想要干净的非英文旁白,外部路线再次胜出:先用 带母语声音的 TTS 工具生成对应语言的音频,再导入。

TTS 不显示?快速修复

  • 点击文字,而不是声音菜单。 这个选项只在选中文字贴纸时出现。
  • 更新 App。 功能和声音列表在版本之间频繁变动。
  • 检查你所在的地区。 部分声音——偶尔甚至整个功能——因国家而异。
  • 用一个新的文字贴纸。 烧录在上传视频里的文字不是贴纸,无法被朗读。
  • 还是不行? 在站外生成旁白,带着现成音频上传——下文有完整工作流。

(至于相反的问题——一个关不掉的朗读者——我们的 开启或关闭文字转语音指南覆盖了所有平台。)

TikTok TTS 的天花板在哪里

内置功能就其定位而言非常完美:快、免费、一听就认得出来。但只要内容一认真起来,它的局限就显露出来了:

TikTok 内置外部 TTS
声音选择约 10 个,轮换中数百个,稳定可用
文案长度字幕级别的贴纸整篇文案,一次生成
可保留的音频文件❌ 合成进视频✅ 可下载 MP3
在其他平台使用模糊不清✅ 商用套餐明确授权
你自己的声音✅ 通过声音克隆实现
那个著名的 TikTok 声音✅ 原版接近,但不完全相同

最后一行是双刃剑。如果笑点就是那个 TikTok 声音,那就用 TikTok 声音——熟悉感本身就是包袱。列表里的其他所有项目,都倾向于在站外生成。

创作者工作流:用上 TikTok 没有的声音

你看到的大多数精良“TTS”内容,背后是三个步骤,而且没有一步是在 TikTok 编辑器里完成的:

创作者工作流:在站外生成旁白并导入 TikTok

  1. 写好文案并生成——在一个拥有真正声音库的 TTS 工具里完成。我们的 文字转语音 MP3 生成器导出的正是你需要的文件,而 免费工具可以在无需账号的情况下做快速测试。
  2. 把音频作为音轨来剪辑——在 CapCut 里(完整导入步骤见我们的 CapCut 文字转语音指南),或者通过 your sounds(我的声音)上传,直接在 TikTok 里完成。
  3. 叠加字幕。 对导入的音频运行自动字幕,让文字与语音逐字对应。

相比内置的十个声音,这套流程解锁的是:比贴纸更长的旁白;每条视频都一致的声音(正是它让一个系列有了节目的感觉);赞助内容所需的商用安全授权——以及,借助 AI 声音克隆,在你没法录音的日子里,一个就是你本人的旁白。

发布前检查清单

按下发布键前的三十秒,为 TTS 视频过一遍:

  • 闭上眼睛听一遍。 跟着字幕读的时候,发音错误会被你自动忽略。
  • 对照剪辑点检查贴纸时长。 语音溢出到转场之后,会被观众当成失误;裁贴纸,别裁视频。
  • 错别字现在变成了声音。 每个拼写错误都被声音永久固定下来——先校对文字,再生成。
  • 注意音量叠加。 TTS 叠在音乐上、再叠在原声上,很快就会变得浑浊;语音说话时把音乐压低。
  • 变现或品牌合作帖? 内置声音受 TikTok 授权条款约束——赞助内容请用授予商用权利的工具生成,再导入。

结论

TikTok 的文字转语音在流行文化里赢得了一席之地:点文字、选 Jessie、发布。当平台声音本身就是重点时,尽管放心用。

但要清楚它的边界——十个轮换的声音、贴纸长度的文案、没有音频文件,以及止步于 TikTok 站内的授权。当一条视频的价值超出单次发布时,在站外生成声音再导入:同样的风格,没有任何天花板。

用任意声音制作你的下一段旁白——免费,无需注册。 输入文案,从完整声音库中挑选,下载 MP3,放进你的剪辑。试试文字转语音 MP3 生成器 →

AnyVoice 团队

AnyVoice 团队