上传一个 WAV,也就是录音机和剪辑软件导出的格式,拿回带时间戳和说话人的转写稿。点击任一段落听它,然后导出。
MP3、WAV、M4A 或 OGG · 最长 30 分钟
请上传你有权转写的录音。转写稿归你所有,音频处理后不保留。
点击任一段落即可听到对应位置。播放时,播放头所在的段落会高亮。你的转写稿就是这个样子。
01—使用方法
不装软件。WAV 原样上传;如果超过 50 MB,下一节会教你先缩成 MP3,转写稿一个字都不会变。结果在独立页面打开,播放器在顶部。
拖入最长三十分钟、最大 50 MB 的文件。上传前就会读出时长,页面会告诉你今天这次是免费的,还是要多少积分。
点击「开始转写」。引擎听一遍,写下每个词和它被说出的那一秒,并区分说话人。十分钟的文件通常一分钟内回来。
转写稿在播放器旁边打开。点击任一段落听它,搜索一句话,重命名说话人,下载纯文本、带时间戳的文本、SRT 或 VTT。
大约是录音时长的十分之一。三分钟的片段几秒钟回来,三十分钟的采访两三分钟。处理时页面有计时器。
02—关于格式
WAV 是未压缩的 PCM 音频,是现场录音机、Audacity、所有 DAW 和多数电话系统的默认导出格式。它把麦克风听到的每一个采样逐个存下来,所以是你能带到 WAV 转文字工具的质量最高的文件,也是体积最大的。
| 录音设置 | 每分钟体积 | 50 MB 能装 |
|---|---|---|
| 48 kHz · 24 位 · 立体声(录音棚) | ≈ 17 MB | ≈ 3 分钟 |
| 44.1 kHz · 16 位 · 立体声(CD 品质) | ≈ 10 MB | ≈ 5 分钟 |
| 16 kHz · 16 位 · 单声道(语音) | ≈ 1.9 MB | ≈ 26 分钟 |
| 同一段音频转成 128 kbps 的 MP3 | ≈ 1 MB | ≈ 50 分钟 |
引擎在听之前会把每个文件降到语音采样率,所以 48 kHz、24 位的录音棚 WAV 并不比 16 kHz 单声道多出任何可用的词。改变转写稿的是房间、麦克风距离和多人抢话。大 WAV 里多出来的数据是给混音用的,不是给转写用的。
如果 WAV 超过 50 MB 或三十分钟,在 Audacity 里导出为 128 kbps 的 MP3,或者下次采访时把录音机设成 MP3 模式。转写稿完全一样,上传快十倍左右。本来就在限制内的 WAV 原样上传即可。
录音机或 Audacity 给文件起的名字,常常是 ZOOM0012.WAV 这类,会成为转写稿的标题和每个导出文件的名字。上传前改个名,或者之后一键给转写稿改名。
转写只需要单声道。左右声道各一人的立体声采访也没问题,因为引擎靠声音而不是靠声道区分说话人。
03—点击段落
录音机上一个小时的文件,为了一句话拖来拖去太费劲。这里,转写稿和音频是一体的,在同一页,每一段都知道自己属于哪一秒。
录音播放时,正在说的那一段会高亮并保持在视野里。点击另一段,播放就跳过去。核对一句引语只要两秒。
输入一句话,转写稿会筛出包含它的段落。点一下,你听到的就是那个时刻。
每段带着它开始的那一秒,从文件里测出来而不是按语速估算,所以你贴进剪辑记录的时间点是准的。
两个声音会被标为说话人 1 和说话人 2。改一次名字,每一段和每个导出文件都会更新。
04—你会得到
一次转换产出四个文件,全部来自同一组带时间的分段,所以纯文本、字幕和带时间戳的版本永远不会互相矛盾。
在说话人停顿或换人的地方分段,可直接粘贴到笔记、文档或邮件里。
同样的段落加上开始时间,或者导出为可以直接放到视频时间轴上的 SRT 和 VTT。
采访和通话回来时每一轮都标好了是谁说的,名字由你来定。
每次转写连同音频会在历史记录里保留三十天,你可以重新打开页面、再播放、之后再导出。上传的 WAV 不会保存在其他任何地方,删掉转写稿会把两者一起删除。
05—WAV 从哪来
WAV 是专业设备和剪辑软件默认写出的格式,所以它通常来自四个地方。每一处都有一个值得在下次录音前知道的设置。
Zoom、Tascam 和 Sony 的录音机出厂就写 WAV,录音乐正合适,录采访就太重了。它们多数也有 MP3 模式,录语音时切过去,转换这一步直接省掉。
剪掉杂音、修好一段之后,导出对话框默认是 WAV。文件是拿去转写的话就选 MP3,转写稿一样,体积只有十分之一。
客服热线和电话采访通常导出 8 kHz 的窄带 WAV,体积小,能正常转写。因为它们往往又薄又吵,先过一遍人声分离,转写稿会明显更好。
播客录音棚和配音会留下又大又干净的 WAV。一条录音的转写稿就是文稿,可以直接送去文字转语音或克隆声音补一句,不用再订一次棚。
它不会转写根本听不清的词,不翻译音频本身,也不是实时字幕。它处理你已有的 WAV 文件,单个最大 50 MB、最长三十分钟;更大的先缩成 MP3,或在自然停顿处分段。
06—常见问题
未压缩的 PCM 音频,是录音机、Audacity、DAW 和电话系统的默认导出格式。它保留麦克风采到的每一个样本,所以听起来最好,也最占空间。
能。上传 WAV,点击「开始转写」,转写稿会带着时间戳和说话人标签打开。点击任一段落听它,然后下载成文本或字幕。
在 Audacity 或任何编辑器里导出为 128 kbps 的 MP3,CD 品质的 WAV 会缩小约十倍;或者在自然停顿处分成两个文件。两种做法转写稿完全一样。
只有超过大小或时长限制时才需要。在限制内的 WAV 原样上传即可。真要转的话,转写不会有任何损失,因为引擎本来就在语音采样率下工作。
不会。同一条录音的 48 kHz、24 位文件和 16 kHz、16 位文件,转出来的稿子一样。改变它的是麦克风距离、背景噪音和多人抢话。
会。每一轮归到一个你可以重命名的说话人,单声道和立体声文件都一样。单人录音不显示标签。
下载纯文本导出,粘贴到 Word 或 Google 文档;想在文档里保留时间就用带时间戳的导出。段落已经按说话人停顿或换人分好。
引擎是为说话人声设计的,混音后的歌曲转出来会断断续续。先用人声伴奏分离拆开,再转写分离出来的人声轨,效果好得多。
07—更多工具
WAV 是录音棚的格式;AnyVoice 的其他工具负责其他格式,以及拿到转写稿之后能做的一切。