上传一个 MP3,拿回带时间戳和说话人的转写稿。点击任一段落就能听到它是在哪一秒说的,然后导出。
MP3、WAV、M4A 或 OGG · 最长 30 分钟
请上传你有权转写的录音。转写稿归你所有,音频处理后不保留。
点击任一段落即可听到对应位置。播放时,播放头所在的段落会高亮。你的转写稿就是这个样子。
01—使用方法
不装软件,也不用先转格式。MP3 原样上传,转写稿在独立页面打开,播放器在顶部,导出按钮在你预期的位置。
拖入最长三十分钟的文件。上传前就会读出时长,页面会告诉你今天这次是免费的,还是要多少积分。
点击「开始转写」。引擎听一遍,写下每个词和它被说出的那一秒,并区分说话人。十分钟的 MP3 通常一分钟内回来。
转写稿在播放器旁边打开。点击任一段落听它,搜索一句话,重命名说话人,下载纯文本、带时间戳的文本、SRT 或 VTT。
大约是录音时长的十分之一。三分钟的语音备忘几秒钟回来,三十分钟的采访两三分钟。处理时页面有计时器。
02—关于格式
MP3 是压缩过的音频文件。它丢掉人耳几乎察觉不到的频率,保留其余部分,所以一段录音体积缩到原来的十分之一左右,人声完整。这也是 MP3 成为 MP3 转文字工具最常见输入格式的原因。
64 kbps 的语音播客和 320 kbps 的音乐文件听起来差别很大,但对转写引擎来说,它们承载的词几乎一样。丢词的不是压缩,而是录音时房间里的噪音。只有远低于 32 kbps 时辅音才开始糊,如今这么小的文件已经很少见。
大多数语音 MP3 是单声道,这对转写正合适。左右声道各一人的立体声采访也没问题。引擎靠声音而不是靠声道区分说话人,所以不需要先重新混音。
你上传的 MP3 文件名会成为转写稿的标题,下载的每个导出文件也以它命名。上传前给文件起一个你认得出的名字,或者之后一键给转写稿改名。
不需要。MP3 不必先变成 WAV 再转写,WAV 或 M4A 也不必先变成 MP3。有什么传什么。这个页面默认期待 MP3,其他格式同样接受。
03—点击段落
MP3 播客往往长达一小时,核对一句引语不该来回拖进度条。这里,转写稿和音频是一体的,在同一页,每一段都知道自己属于哪一秒。
MP3 播放时,正在说的那一段会高亮并保持在视野里。点击另一段,播放就跳过去。核对一句引语只要两秒。
输入一句话,转写稿会筛出包含它的段落。点一下,你听到的就是那个时刻。
每段带着它开始的那一秒,从文件里测出来而不是按语速估算,所以你贴进节目笔记的时间点是准的。
两个声音会被标为说话人 1 和说话人 2。改一次名字,每一段和每个导出文件都会更新。
04—你会得到
一次转换产出四个文件,全部来自同一组带时间的分段,所以纯文本、字幕和带时间戳的版本永远不会互相矛盾。
在说话人停顿或换人的地方分段,可直接粘贴到笔记、文档或邮件里。
同样的段落加上开始时间,或者导出为可以直接放到视频时间轴上的 SRT 和 VTT。
采访和通话回来时每一轮都标好了是谁说的,名字由你来定。
每次转写连同音频会在历史记录里保留三十天,你可以重新打开页面、再播放、之后再导出。上传的 MP3 不会保存在其他任何地方,删掉转写稿会把两者一起删除。
05—MP3 从哪来
MP3 是下载和导出时最常用的格式,所以大量语音都以它到达。下面是 MP3 通常来自的六个地方,以及每种情况下把它转成文字能得到什么。
为节目笔记摘引用,找到某个话题出现的那一分钟,给爱读不爱听的人发一份文字稿。
采访和讲座直接从设备导出。一支贴近说话人的麦克风,胜过桌子中间一支好麦克风。
带说话人的转写稿就是谁承诺了什么的记录。搜一个名字或一个日期,而不是重放一小时。
录下来的课变成带时间戳的笔记,学生可以回到讲解某个概念的那一分钟。
十年前存成 MP3 的采访,和今天录的一样能转。压缩从来不是问题,录音的那个房间才是。
引擎是为说话人声设计的,不是为歌唱。要歌词,先用人声伴奏分离拆开歌曲,再单独转写人声轨,结果明显更干净。
它不会转写根本听不清的词,不翻译音频本身,也不是实时字幕。它处理你已有的 MP3 文件,单个最长三十分钟;更长的在自然停顿处分成两段分别转换。
06—常见问题
能。上传 MP3,点击「开始转写」,转写稿会带着时间戳和说话人标签打开。点击任一段落听它,然后下载成文本或字幕。
每个登录账号每天有三次免费转换,每次最长十分钟,所有导出格式都可用。付费套餐取消每日限制、单个文件最长三十分钟,按分钟扣积分。费率见定价页。
一两个人的清晰录音,接近一个认真听写的人写下的结果。MP3 压缩几乎不影响;背景噪音、麦克风太远和多人抢话才会拉低准确率。先用人声分离清理音频比什么都管用。
实际上不会。64 kbps 的语音和 320 kbps 的语音转写效果一样。只有远低于 32 kbps 的文件才开始丢辅音,而麦克风距离比比特率重要得多。
会。每段带着来自音频的开始时间,每一轮归到一个你可以重命名的说话人。单人录音不显示标签。
引擎是为说话人声设计的,混音后的歌曲转出来会断断续续。先用人声伴奏分离拆开歌曲,再转写分离出来的人声轨,效果好得多。
单个文件最大 50 MB、最长三十分钟。一小时的播客 MP3 通常在大小限制以内,在自然停顿处分成两个文件转换即可。
纯文本、带时间戳的文本、SRT 和 VTT。每个导出文件都以你上传的 MP3 命名,interview.mp3 转完就是 interview.srt。
07—更多工具
MP3 只是众多格式之一,而转写稿一旦存在就是一份文稿。AnyVoice 的其他工具负责前后两端。