音频转文字

上传一段录音,拿回带时间戳和说话人的转写稿。点击任一段落就能听到它是在哪一秒说的,然后导出。

MP3、WAV、M4A 或 OGG · 最长 30 分钟

时间戳 + 说话人今天还有 3 次免费转写

请上传你有权转写的录音。转写稿归你所有,音频处理后不保留。

语音转文字每天 3 次免费,每次最长 10 分钟。付费套餐每分钟 300 积分,单次最长 30 分钟。
0:00 / 0:33

点击任一段落即可听到对应位置。播放时,播放头所在的段落会高亮。你的转写稿就是这个样子。

01使用方法

三步把音频转写成文字

不装软件,不排队,不用对着录音打字。转换器在浏览器里运行,转写稿在独立页面交给你,播放器在顶部,导出按钮在你预期的位置。

  1. 1

    上传音频文件

    拖入最长三十分钟的 MP3、WAV、M4A 或 OGG。上传前就会读出时长,页面会告诉你今天这次是免费的,还是要多少积分。

  2. 2

    把音频转成文字

    点击「开始转写」。引擎听一遍,写下每个词和它被说出的那一秒,并区分说话人。十分钟的文件通常一分钟内完成。

  3. 3

    对照音频核对,然后导出

    转写稿在播放器旁边打开。点击任一段落听它,搜索一句话,重命名说话人,下载纯文本、带时间戳的文本、SRT 或 VTT。

音频转文字要多久

大约是录音时长的十分之一。三分钟的语音备忘几秒钟回来,三十分钟的采访两三分钟。处理时页面有计时器,你不用猜。

02基础概念

什么是音频转文字?

音频转文字(audio to text)是把一段完整录音转成转写稿的软件:每一个说出的词、说出的时刻,以及是谁说的。它处理的是文件而不是实时麦克风,所以在决定任何一个词之前,可以先读完整段录音。

音频转文字 vs. 听写

听写在你说话时打字,永远看不到完整的句子。转换器读完整个文件,所以标点落在正确的位置,含糊的词靠前后文判断,每一段都有真实的时间戳。这也是它能区分说话人的原因:先听完整段对话,再给每一段贴标签。

为什么录音比工具更重要

所有转写引擎处理的都是麦克风录到的内容。音乐、车流和房间回声都会丢词。如果文件很糙,先用人声分离清理,再转写干净的版本;转写稿的差别比换一个转换器的差别大得多。

你需要哪一个?

想靠说话打字,用手机或文档编辑器自带的听写。想把已有录音里的话连同时间和说话人一起拿出来,用这个转换器。

03点击段落

点击任一段落,听它

大多数转换器给你一堵文字墙和一个分开的播放器,核对一个词就得拖进度条。这里,转写稿和音频是一体的,在同一页,每一段都知道自己属于哪一秒。

转写稿跟着播放头走

音频播放时,正在说的那一段会高亮并保持在视野里。点击另一段,播放就跳过去。核对一句引语只要两秒。

先搜索,再听

输入一句话,转写稿会筛出包含它的段落。点一下,你听到的就是那个时刻。

取自音频本身的时间戳

每段带着它开始的那一秒,是测出来的,不是按语速估算的。

可以重命名的说话人

两个声音会被标为说话人 1 和说话人 2。改一次名字,每一段和每个导出文件都会更新。

04你会得到

音频转文字会给你什么

一次转换产出四个文件,全部来自同一组带时间的分段,所以纯文本、字幕和带时间戳的版本永远不会互相矛盾。

纯文本

在说话人停顿或换人的地方分段,可直接粘贴到笔记、文档或邮件里。

带时间戳的文本和字幕

同样的段落加上开始时间,或者导出为可以直接放到视频时间轴上的 SRT 和 VTT。

说话人标签

采访和通话回来时每一轮都标好了是谁说的,名字由你来定。

任意音频格式

播客的 MP3、录音笔的 WAV、iPhone 语音备忘录的 M4A、聊天软件的 OGG,转换器都能读。转换之前不需要先转格式。

05示例

音频转文字的转写稿长什么样

这是一段三十秒双人录音的真实输出,不是效果图。时间戳标出每段开始的位置,说话人标签来自引擎,高亮的那一段就是播放头所在的位置。

0:00说话人 1Welcome back to the show. Today we're talking about turning recordings into text and why so many people still do it by hand.
0:07说话人 2Thanks for having me. Honestly, the part people miss is that a clean recording makes everything downstream easier, the transcript, the captions, all of it.
0:17说话人 1So what do you do when the audio is noisy, a cafe interview, wind on a phone recording, that kind of thing?
0:25说话人 2Run it through a voice isolator first, then transcribe. The difference in accuracy is night and day, and it takes about a minute.

怎么读这个示例

每一段是一个说话人的一轮发言,长的发言会拆成一两句。上一段结束到下一段开始之间的空隙,就是录音里的停顿。语气词保留着,因为把人修剪过的转写稿听起来谁都不像。

录音更糙时会有什么变化

引擎不太确定断点的地方段落会变长,生僻名字会按发音拼写,抢话的说话人可能共用一段。这些在转写稿视图里都能改,而且大部分靠先清理音频就能避免。

06使用场景

人们都转换什么

凡是说过一次、需要被读、被搜、被引用很多次的内容,把录音转成文字就值得。下面是它最常做的六件事,以及时间戳和说话人标签分别带来了什么。

播客单集

为节目笔记摘引用,找到某个话题出现的那一分钟,给读者发一份文字稿。

采访与语音备忘

每个回答都有文字并标好说话人,需要核对引语时录音一点就到。

讲座与课程

录下来的课变成带时间戳的笔记,学生可以回到讲解某个概念的那一分钟。

会议

带说话人的转写稿就是谁承诺了什么的记录。搜一个名字或一个日期,而不是重放一小时。

字幕

导出 SRT 或 VTT,视频就有了字幕,不用对着时钟打字。

用你自己的声音念的稿子

转写稿就是一份文稿。送去文字转语音,或者克隆你的声音,听这些话用你的声音再读一遍,不用重新拿起麦克风。

它做不到的事

它不会转写根本听不清的词,不做翻译,也不是实时字幕。它处理的是你已有的文件,单个最长三十分钟;更长的录音在自然停顿处分成两段分别转换。

07对比

音频转文字工具 vs. 人工听写 vs. 转写服务

把录音变成文字有三条路,速度、成本和拿到的东西各不相同。

音频转文字工具自己打字转写服务
周转时间一分钟内录音时长的 4–6 倍几小时到几天
时间戳手动有时
说话人标签手动
点击段落即可听
每十分钟的成本每天免费,之后积分你一小时的时间按分钟收费
用你的声音读回来

转换器是正确的默认选择。只有录音糙到任何引擎都搞不定时才自己打字,只有交付物需要人工担保时才付费找服务。

08最佳实践

拿到更干净的转写稿

引擎负责干活,但录音决定了之后要改多少个词。三个习惯覆盖了「改十分钟」和「改十秒钟」之间的大部分差距。

最大的一项改进

噪音。人声背后的车流、音乐或风扇会丢掉干净录音能留住的词。先把糙音频过一遍人声分离,大约一分钟,转写稿明显更好。

一支麦克风,离得近

四个人中间放一部手机录到的是房间。近比响重要。

让说话人说完

同时说话是任何转写引擎最难的情况。轮流说话的录音回来很干净;争得激烈的讨论,两个声音落在同一秒的地方需要再看一眼。

事后搜名字

生僻的名字和产品术语是转写稿最容易出错的地方。搜一下,改一次,导出。

09常见问题

常见问题

音频转文字工具免费吗?

每个登录账号每天有三次免费转换,每次最长十分钟,所有导出格式都可用。付费套餐取消每日限制、单个文件最长三十分钟,按分钟扣积分。费率见定价页。

怎么把音频转写成文字?

上传文件,点击「开始转写」,通常一分钟内转写稿就绪。点击任一段落听它,然后下载成文本或字幕。

能转换哪些音频格式?

MP3、WAV、M4A 和 OGG,单个文件最大 50 MB、最长三十分钟。手机的语音备忘和播客下载文件可以直接用。

会加时间戳和说话人标签吗?

会。每段带着来自音频的开始时间,每一轮归到一个你可以重命名的说话人。单人录音不显示标签。

音频转文字的准确率如何?

一两个人的清晰录音,接近一个认真听写的人写下的结果。噪音、麦克风太远和多人抢话会降低准确率。先清理音频比什么都管用,转完后搜一遍名字能解决剩下的大部分。

能把视频转成文字吗?

暂时不能直接处理。先把视频的音轨导出为 MP3 或 WAV,转换它,再用 SRT 导出给视频加字幕。

支持哪些语言?

大多数常用语言,以原语言转写。语言自动检测。

我的录音会被保存吗?

转写稿和它的音频会在历史记录里保留三十天,方便你重新打开和导出,随时可以删除。上传的文件不会保存在其他任何地方。

音频转文字 — 在线免费把录音转成文字