上传一段录音,拿回带时间戳和说话人的转写稿。点击任一段落就能听到它是在哪一秒说的,然后导出。
MP3、WAV、M4A 或 OGG · 最长 30 分钟
请上传你有权转写的录音。转写稿归你所有,音频处理后不保留。
点击任一段落即可听到对应位置。播放时,播放头所在的段落会高亮。你的转写稿就是这个样子。
01—使用方法
不装软件,不排队,不用对着录音打字。转换器在浏览器里运行,转写稿在独立页面交给你,播放器在顶部,导出按钮在你预期的位置。
拖入最长三十分钟的 MP3、WAV、M4A 或 OGG。上传前就会读出时长,页面会告诉你今天这次是免费的,还是要多少积分。
点击「开始转写」。引擎听一遍,写下每个词和它被说出的那一秒,并区分说话人。十分钟的文件通常一分钟内完成。
转写稿在播放器旁边打开。点击任一段落听它,搜索一句话,重命名说话人,下载纯文本、带时间戳的文本、SRT 或 VTT。
大约是录音时长的十分之一。三分钟的语音备忘几秒钟回来,三十分钟的采访两三分钟。处理时页面有计时器,你不用猜。
02—基础概念
音频转文字(audio to text)是把一段完整录音转成转写稿的软件:每一个说出的词、说出的时刻,以及是谁说的。它处理的是文件而不是实时麦克风,所以在决定任何一个词之前,可以先读完整段录音。
听写在你说话时打字,永远看不到完整的句子。转换器读完整个文件,所以标点落在正确的位置,含糊的词靠前后文判断,每一段都有真实的时间戳。这也是它能区分说话人的原因:先听完整段对话,再给每一段贴标签。
所有转写引擎处理的都是麦克风录到的内容。音乐、车流和房间回声都会丢词。如果文件很糙,先用人声分离清理,再转写干净的版本;转写稿的差别比换一个转换器的差别大得多。
想靠说话打字,用手机或文档编辑器自带的听写。想把已有录音里的话连同时间和说话人一起拿出来,用这个转换器。
03—点击段落
大多数转换器给你一堵文字墙和一个分开的播放器,核对一个词就得拖进度条。这里,转写稿和音频是一体的,在同一页,每一段都知道自己属于哪一秒。
音频播放时,正在说的那一段会高亮并保持在视野里。点击另一段,播放就跳过去。核对一句引语只要两秒。
输入一句话,转写稿会筛出包含它的段落。点一下,你听到的就是那个时刻。
每段带着它开始的那一秒,是测出来的,不是按语速估算的。
两个声音会被标为说话人 1 和说话人 2。改一次名字,每一段和每个导出文件都会更新。
04—你会得到
一次转换产出四个文件,全部来自同一组带时间的分段,所以纯文本、字幕和带时间戳的版本永远不会互相矛盾。
在说话人停顿或换人的地方分段,可直接粘贴到笔记、文档或邮件里。
同样的段落加上开始时间,或者导出为可以直接放到视频时间轴上的 SRT 和 VTT。
采访和通话回来时每一轮都标好了是谁说的,名字由你来定。
播客的 MP3、录音笔的 WAV、iPhone 语音备忘录的 M4A、聊天软件的 OGG,转换器都能读。转换之前不需要先转格式。
05—示例
这是一段三十秒双人录音的真实输出,不是效果图。时间戳标出每段开始的位置,说话人标签来自引擎,高亮的那一段就是播放头所在的位置。
每一段是一个说话人的一轮发言,长的发言会拆成一两句。上一段结束到下一段开始之间的空隙,就是录音里的停顿。语气词保留着,因为把人修剪过的转写稿听起来谁都不像。
引擎不太确定断点的地方段落会变长,生僻名字会按发音拼写,抢话的说话人可能共用一段。这些在转写稿视图里都能改,而且大部分靠先清理音频就能避免。
06—使用场景
凡是说过一次、需要被读、被搜、被引用很多次的内容,把录音转成文字就值得。下面是它最常做的六件事,以及时间戳和说话人标签分别带来了什么。
为节目笔记摘引用,找到某个话题出现的那一分钟,给读者发一份文字稿。
每个回答都有文字并标好说话人,需要核对引语时录音一点就到。
录下来的课变成带时间戳的笔记,学生可以回到讲解某个概念的那一分钟。
带说话人的转写稿就是谁承诺了什么的记录。搜一个名字或一个日期,而不是重放一小时。
导出 SRT 或 VTT,视频就有了字幕,不用对着时钟打字。
转写稿就是一份文稿。送去文字转语音,或者克隆你的声音,听这些话用你的声音再读一遍,不用重新拿起麦克风。
它不会转写根本听不清的词,不做翻译,也不是实时字幕。它处理的是你已有的文件,单个最长三十分钟;更长的录音在自然停顿处分成两段分别转换。
07—对比
把录音变成文字有三条路,速度、成本和拿到的东西各不相同。
| 音频转文字工具 | 自己打字 | 转写服务 | |
|---|---|---|---|
| 周转时间 | 一分钟内 | 录音时长的 4–6 倍 | 几小时到几天 |
| 时间戳 | 手动 | 有时 | |
| 说话人标签 | 手动 | ||
| 点击段落即可听 | |||
| 每十分钟的成本 | 每天免费,之后积分 | 你一小时的时间 | 按分钟收费 |
| 用你的声音读回来 |
转换器是正确的默认选择。只有录音糙到任何引擎都搞不定时才自己打字,只有交付物需要人工担保时才付费找服务。
08—最佳实践
引擎负责干活,但录音决定了之后要改多少个词。三个习惯覆盖了「改十分钟」和「改十秒钟」之间的大部分差距。
噪音。人声背后的车流、音乐或风扇会丢掉干净录音能留住的词。先把糙音频过一遍人声分离,大约一分钟,转写稿明显更好。
四个人中间放一部手机录到的是房间。近比响重要。
同时说话是任何转写引擎最难的情况。轮流说话的录音回来很干净;争得激烈的讨论,两个声音落在同一秒的地方需要再看一眼。
生僻的名字和产品术语是转写稿最容易出错的地方。搜一下,改一次,导出。
09—常见问题
每个登录账号每天有三次免费转换,每次最长十分钟,所有导出格式都可用。付费套餐取消每日限制、单个文件最长三十分钟,按分钟扣积分。费率见定价页。
上传文件,点击「开始转写」,通常一分钟内转写稿就绪。点击任一段落听它,然后下载成文本或字幕。
MP3、WAV、M4A 和 OGG,单个文件最大 50 MB、最长三十分钟。手机的语音备忘和播客下载文件可以直接用。
会。每段带着来自音频的开始时间,每一轮归到一个你可以重命名的说话人。单人录音不显示标签。
一两个人的清晰录音,接近一个认真听写的人写下的结果。噪音、麦克风太远和多人抢话会降低准确率。先清理音频比什么都管用,转完后搜一遍名字能解决剩下的大部分。
暂时不能直接处理。先把视频的音轨导出为 MP3 或 WAV,转换它,再用 SRT 导出给视频加字幕。
大多数常用语言,以原语言转写。语言自动检测。
转写稿和它的音频会在历史记录里保留三十天,方便你重新打开和导出,随时可以删除。上传的文件不会保存在其他任何地方。
10—读回来
文字落在页面上以后,AnyVoice 的其他工具可以把它再说一遍。