每次刷视频都会碰到它:那个明亮、略显过分欢快的声音,正在一条日常 vlog 上朗读字幕。TikTok 的文字转语音(TTS)不只是一个功能——它已经是这个平台声音的一部分。
这篇指南回答大家真正在搜的三个问题:怎么打开它、这些声音叫什么(包括所有人都在问的那一个),以及创作者是怎么用上 TikTok 没有的声音的。
这篇文章你会学到:
- 20 秒上手教程(以及为什么这个选项藏在文字贴纸里)
- “Jessie”声音背后的真人——以及导致换声的那场诉讼
- 关于“中文口音声音”的一个诚实回答
- TTS 不显示时的修复方法,以及突破内置十个声音的工作流
TikTok 上怎么用文字转语音
这个功能的位置有点反直觉——它挂在文字上,而不是在音频工具里:
- 录制或上传视频,点击对勾进入编辑页面。
- 点击 Text(文字),输入你的字幕。
- 点击文字贴纸本身,在弹出菜单中选择 Text-to-speech(文字转语音)。
- 从列表中挑选一个声音——点一下即可试听——然后确认。
语音会一字不差地朗读贴纸上的内容,并与贴纸在画面上出现的时间同步。三个教程里通常不讲的实用细节:
- 时长 = 贴纸时长。 裁剪文字贴纸的时间轴,就能控制语音什么时候开口。
- 多个贴纸,多次朗读。 每个文字元素都会单独生成一次 TTS——创作者就是这样做出一来一往的“对话”的。
- 拼写即发音。 声音会照你打的字念,错别字也不放过。故意拼错(比如“gorls”)正是创作者引导它发音的方法。
这些声音都叫什么
Jessie:TikTok 之声
默认女声——大家说“TikTok 那个声音”时指的就是她——被社区命名为 Jessie,而她是一个真人:加拿大电台主持人 Kat Callaghan。
这段背景故事的意义远不止冷知识:最初的北美女声在 2021 年被替换,原因是配音演员 Bev Standing 起诉 TikTok 母公司未经授权使用她的声音。案件以和解告终,声音随之更换,而它至今仍是声音权益走进现实法律最清晰的早期案例之一——正是这股潮流催生了今天的授权规则,我们在 AI 声音克隆法律指南里持续跟踪。
其余阵容
TikTok 在任一时期轮换着大约 十个英文声音,另外还有其他市场的地区性声音。社区给它们起的名字(TikTok 官方几乎不标注)可以归为几个家族:
| 家族 | 听起来像什么 | 典型用途 |
|---|---|---|
| Jessie / 默认女声 | 温暖、欢快、电台级打磨 | Vlog、故事分享,万能款 |
| 标准男声 | 平稳、像新闻播报 | 讲解类、POV 视频 |
| 角色声 | 幽灵、花栗鼠式的变调玩法 | 搞笑、短剧 |
| 演唱声 | 把你的文字唱出来 | 热门趋势、梗视频 |
| 地区性声音 | 英式及其他市场的口音 | 本地化内容 |
两条经验之谈:这份阵容会在不发公告的情况下变动(半年前教程里的声音可能已经消失),而且可用性因地区而异——你在爆款视频里听到的某个声音,在你所在国家的 App 里可能根本不存在。
创作者真正在用的六个 TTS 技巧
功能本身只要点四下;功夫全在人们怎么把它玩出花样。
1. 为耳朵拼写,而不是为眼睛
声音会严格照打出来的字发音,所以创作者用刻意的拼写错误来引导它——拉长元音以加强语气、把它读错的名字按发音重拼,或者干脆顺着某个错误发音,把它玩成梗。
2. 标点就是节奏
句号换来停顿,逗号换来更短的停顿,一串省略号能让声音在揭晓前吊足胃口。改写一句话的标点,是不动剪辑就能修正喜剧节奏的最快方法。
3. 多贴纸对话
两个文字贴纸、两个声音、交替出现的画面时机——“两个声音在吵架”类视频的全部机制就是这样。每个贴纸都保持简短,对话才有爆发力。
4. 面无表情的反差
最经久不衰的 TTS 笑点格式:一个无比欢快的声音,朗读极其平淡或极其丧的文字。反差本身就是笑点,这也是为什么在这种玩法里,默认声音比“更搞笑”的角色声效果更好。
5. 藏起文字,留下声音
生成之后,在你想要旁白但不想要画面文字的时段,把贴纸缩小并拖出画面(或压到另一个元素下面)。音频保留,字幕消失。
6. TTS 当钩子,真人做主体
口播视频的一种常见结构:先由 TTS 朗读第一句——这是每个刷视频的人都认得的“模式打断”——然后切换到创作者的真实声音。熟悉的声音引人进门,真人的连接留住观众。
TTS 会帮助还是拖累流量?
坦白说:没有任何可信证据表明算法会偏爱或惩罚 TTS 本身。可量化带来帮助的,是 TTS 所促成的东西——有字幕、静音也能看懂、开头钩子清晰的视频。把这个声音当作无障碍与留存工具,而不是排名外挂。
“那个口音声音叫什么?”——一个诚实的回答
TikTok TTS 被搜得最多的问题之一,是梗视频里那个带中文口音的声音。诚实的回答,任何清单文章都不会告诉你:
TikTok 没有官方命名的口音声音。 它的声音列表没有标签、因地区而异且不断轮换。爆款视频里带口音的声音,通常是以下三种之一:
- 另一个市场 App 里的地区性 TTS 声音,导出后被反复使用。
- 外部工具的声音,在站外生成后作为音频添加。
- 一段热门音频——别人的原创声音,被成千上万次复用。
可靠的辨认方法:点击视频上旋转的唱片 / 声音名称。如果是复用的声音,你能看到它的来源。如果是合成进视频的 TTS,它无法被提取——但可以被重现:外部 TTS 声音库里有各种带口音的英文声音(包括带普通话口音的英语),能让你用一个真正获得授权的声音做出同样的效果。
⚠️ 注意: 重现某个特定真人的声音,和使用一个带口音的素材库声音是两回事——前者永远需要本人授权。上文提到的 Bev Standing 诉讼,正是这条界线存在的意义。
别搞混:TTS 与 TikTok 的声音特效
TikTok 有两个不同的功能都被叫作“那个声音功能”,把它们混为一谈,会让人在错误的菜单里翻半天:
- **文字转语音(Text-to-speech)**根据输入的文字生成一个全新的声音。它挂在文字贴纸上。
- **声音特效(Voice effects)**对你录下的声音进行变形——花栗鼠、低沉、机器人、回声。它们位于编辑页面的 Audio editing / Voice effects(音频编辑 / 声音特效)图标下,且只对 App 内录制的音频有效。
判断方法:如果视频里的旁白没有人打过字,那就是声音特效(或导入的音轨),而不是 TTS。而如果你真正想要的是第三种东西——让你的录音用一个不同但真实的声音来演绎,而不是变调搞笑——那就是 AI 变声器的活儿,它可以处理任意音频文件,而不局限于 App 内的录音。
图文模式下 TTS 能用吗?
能——图文模式帖子里的文字贴纸同样支持文字转语音,它已经成了幻灯片故事分享的标配。规则不变:语音跟随每张图片上的贴纸。
顺便说说其他语言
输入非英文文字,英文声音会按发音硬念——通常念得很糟。TikTok 是按地区提供不同的声音集,而不是一个多语言声音,所以想要干净的非英文旁白,外部路线再次胜出:先用 带母语声音的 TTS 工具生成对应语言的音频,再导入。
TTS 不显示?快速修复
- 点击文字,而不是声音菜单。 这个选项只在选中文字贴纸时出现。
- 更新 App。 功能和声音列表在版本之间频繁变动。
- 检查你所在的地区。 部分声音——偶尔甚至整个功能——因国家而异。
- 用一个新的文字贴纸。 烧录在上传视频里的文字不是贴纸,无法被朗读。
- 还是不行? 在站外生成旁白,带着现成音频上传——下文有完整工作流。
(至于相反的问题——一个关不掉的朗读者——我们的 开启或关闭文字转语音指南覆盖了所有平台。)
TikTok TTS 的天花板在哪里
内置功能就其定位而言非常完美:快、免费、一听就认得出来。但只要内容一认真起来,它的局限就显露出来了:
| TikTok 内置 | 外部 TTS | |
|---|---|---|
| 声音选择 | 约 10 个,轮换中 | 数百个,稳定可用 |
| 文案长度 | 字幕级别的贴纸 | 整篇文案,一次生成 |
| 可保留的音频文件 | ❌ 合成进视频 | ✅ 可下载 MP3 |
| 在其他平台使用 | 模糊不清 | ✅ 商用套餐明确授权 |
| 你自己的声音 | ❌ | ✅ 通过声音克隆实现 |
| 那个著名的 TikTok 声音 | ✅ 原版 | 接近,但不完全相同 |
最后一行是双刃剑。如果笑点就是那个 TikTok 声音,那就用 TikTok 声音——熟悉感本身就是包袱。列表里的其他所有项目,都倾向于在站外生成。
创作者工作流:用上 TikTok 没有的声音
你看到的大多数精良“TTS”内容,背后是三个步骤,而且没有一步是在 TikTok 编辑器里完成的:
- 写好文案并生成——在一个拥有真正声音库的 TTS 工具里完成。我们的 文字转语音 MP3 生成器导出的正是你需要的文件,而 免费工具可以在无需账号的情况下做快速测试。
- 把音频作为音轨来剪辑——在 CapCut 里(完整导入步骤见我们的 CapCut 文字转语音指南),或者通过 your sounds(我的声音)上传,直接在 TikTok 里完成。
- 叠加字幕。 对导入的音频运行自动字幕,让文字与语音逐字对应。
相比内置的十个声音,这套流程解锁的是:比贴纸更长的旁白;每条视频都一致的声音(正是它让一个系列有了节目的感觉);赞助内容所需的商用安全授权——以及,借助 AI 声音克隆,在你没法录音的日子里,一个就是你本人的旁白。
发布前检查清单
按下发布键前的三十秒,为 TTS 视频过一遍:
- 闭上眼睛听一遍。 跟着字幕读的时候,发音错误会被你自动忽略。
- 对照剪辑点检查贴纸时长。 语音溢出到转场之后,会被观众当成失误;裁贴纸,别裁视频。
- 错别字现在变成了声音。 每个拼写错误都被声音永久固定下来——先校对文字,再生成。
- 注意音量叠加。 TTS 叠在音乐上、再叠在原声上,很快就会变得浑浊;语音说话时把音乐压低。
- 变现或品牌合作帖? 内置声音受 TikTok 授权条款约束——赞助内容请用授予商用权利的工具生成,再导入。
结论
TikTok 的文字转语音在流行文化里赢得了一席之地:点文字、选 Jessie、发布。当平台声音本身就是重点时,尽管放心用。
但要清楚它的边界——十个轮换的声音、贴纸长度的文案、没有音频文件,以及止步于 TikTok 站内的授权。当一条视频的价值超出单次发布时,在站外生成声音再导入:同样的风格,没有任何天花板。
用任意声音制作你的下一段旁白——免费,无需注册。 输入文案,从完整声音库中挑选,下载 MP3,放进你的剪辑。试试文字转语音 MP3 生成器 →
