语音转文字
登录

AI 语音转文字

上传或录音,得到带时间戳和说话人标签的转写稿,点击任一段落就能听到它是在哪一秒说的。

MP3、WAV、M4A 或 OGG · 最长 30 分钟

时间戳 + 说话人今天还有 3 次免费转写

请上传你有权转写的录音。转写稿归你所有,音频处理后不保留。

语音转文字每天 3 次免费,每次最长 10 分钟。付费套餐每分钟 300 积分,单次最长 30 分钟。
0:00 / 0:33

点击任一段落即可听到对应位置。播放时,播放头所在的段落会高亮。你的转写稿就是这个样子。

01使用方法

三步把语音转成文字

整个过程在浏览器里完成:不装听写软件,不装编辑器插件,不在应用之间复制粘贴。上传,稍等,阅读。转写稿不会出现在按钮下方,它会在独立页面打开,播放器在顶部,导出按钮在你预期的位置。

  1. 1

    上传或录音

    拖入最长三十分钟的 MP3、WAV、M4A 或 OGG,或者点击「录音」直接说。上传前就会显示时长,以及消耗积分或「今天这次免费」的提示。

  2. 2

    转写

    点击「开始转写」。语音转文字引擎听一遍,写下每个词和它的时间,并判断是谁在说。十分钟的录音通常一分钟内返回。

  3. 3

    阅读、点击、导出

    转写稿在独立页面打开,播放器在顶部。点击任一段落听它,搜索一句话,重命名说话人,然后下载纯文本、带时间戳的文本、SRT 或 VTT。

开始前需要什么

一段有人说话的录音,和一个账号。别的都不需要。免费额度是每天三次、每次最长十分钟,大多数采访、语音备忘和课程片段都够用。

02基础概念

什么是语音转文字?

语音转文字(speech to text)是由软件把说话的音频转换成书面文字。现代的语音转文字会听完整段录音,写下每个词和它被说出的时刻,并区分不同的说话人,所以结果是一份带时间轴的转写稿,而不是一堵文字墙。

语音转文字 vs. 语音输入

手机或文档里的语音输入是实时的:你说,它打,它永远看不到完整的句子。对录音做转写则一次看到全部内容,所以能正确断句,能根据前后文判断一个词,并给每一段附上时间戳。这也是它能区分说话人的原因:先听完整段对话,再给每一段贴标签。

文字从哪里来

引擎处理的是麦克风录到的内容。背景音乐、风声和房间回声都会损失准确率。如果录音很糙,先用人声分离处理一遍,再转写干净的版本。

你需要哪一个?

想靠说话来打字,用手机或文字处理软件自带的语音输入。手里有录音、想把里面的话连同时间和说话人一起拿出来,用这个页面。

03点击段落

点击任一段落,听它

大多数转写工具给你一块文字,让你自己在音频里拖来拖去核对某个词。这里,转写稿和播放器是一体的,在同一页,每一段都知道自己属于哪一秒。

转写稿跟着音频走

录音播放时,正在说的那一段会高亮,列表会把它保持在视野里。点击另一段,播放就跳过去。核对一个听着不对的词只要两秒,不用翻找。

先搜索,再听

输入一句话,转写稿会筛出包含它的段落并高亮匹配。点一下,你听到的就是那个时刻。

可信的时间戳

每段带着它开始的那一秒,取自音频本身而不是按语速估算,所以你写进节目笔记的时间点是准的。

说话人由你命名

两个人会被标为说话人 1 和说话人 2。改一次名字,转写稿和所有导出文件里的每一段都会更新。

04你会得到

语音转文字会给你什么

一次转写,四个文件,全部来自同一组带时间的分段。

纯文本

在说话人停顿或换人的地方分段,保留语气词,转写稿听起来还是那个人。粘贴到笔记、文档或邮件里,或者直接交给文字转语音。

带时间戳的文本和字幕

同样的段落加上开始时间,或者导出为可以直接放到视频时间轴上的 SRT 和 VTT。

说话人标签

采访和通话回来时每一轮都标好了是谁说的。把说话人 1 改成真名,标签跟着走。

转写稿放在哪里

每次转写连同音频会在历史记录里保留三十天,你可以重新打开页面、再播放、之后再导出。上传的文件不会保存在其他任何地方,删掉的转写稿会从历史记录和存储中一起消失。

05使用场景

人们都转写什么

凡是说过一次、需要被读很多次的内容,转写就有用武之地。下面是它最常做的六件事,以及时间戳和说话人标签分别带来了什么。

播客单集

为节目笔记摘引用,找到某个话题出现的那一分钟,给爱读不爱听的人发一份文字稿。

采访与通话

每个回答都有文字并标好说话人,需要核对引语时一键回到录音。

讲座与课程

把录下来的课变成带时间戳的笔记,学生可以回到讲解某个概念的那一分钟。

会议

带说话人的转写稿就是谁承诺了什么的记录。搜一个名字或一个日期,而不是重放一小时。

字幕

导出 SRT 或 VTT,视频就有了字幕,不用对着时钟打字。

用你自己的声音念的稿子

转写稿就是一份文稿。把它送去文字转语音,或者克隆你的声音,让这些话用你的声音再读一遍,不用重新拿起麦克风。

它做不到的事

它不会转写根本听不清的词,不做翻译,也不是实时字幕服务。它处理的是你已有的录音,单次最长三十分钟;更长的录音在自然停顿处分成两段分别转写。

06对比

语音转文字 vs. 语音输入 vs. 会议助手

三类产品都叫「语音转文字」,解决的却是不同的问题。

语音转文字(本工具)语音输入会议助手
输入你已有的录音你实时的声音它加入的实时通话
时间戳
说话人标签
点击段落即可听有时
任意文件都能处理
用你的声音读回来

想靠说话打字,用语音输入。想让机器人进你的会议,用会议助手。手里有录音、想把话拿出来、音频一点就到,用这个页面。

07最佳实践

拿到更准确的转写稿

引擎负责干活,但你喂给它什么,决定了之后要改多少个词。三个习惯覆盖了「改十分钟」和「改十秒钟」之间的大部分差距。

最大的一项改进

噪音。背后有车流、音乐或风扇的录音,会丢掉干净录音能留住的词。先把糙音频过一遍人声分离,大约一分钟,转写稿明显更干净。

一支麦克风,离得近

四个人中间放一部手机录到的是房间,不是人。近比响重要,每人一支麦克风比中间一支好麦克风更好。

让说话人说完

同时说话是任何转写引擎最难的情况。轮流说话的录音回来很干净;争得激烈的讨论,凡是两个声音落在同一秒的地方都要再看一眼。

事后搜名字

生僻的名字和产品术语是转写稿最容易出错的地方。转完以后搜一下,在文档里改一次。

08常见问题

常见问题

语音转文字工具免费吗?

每个登录账号每天有三次免费转写,每次最长十分钟,所有导出格式都可用。付费套餐取消每日限制、单个文件最长三十分钟,按分钟扣积分。费率见定价页。

需要账号吗?

需要。转写稿连同音频保存在你的历史记录里方便回看,免费额度按账号计算。

支持哪些语言?

大多数常用语言的录音都会以原语言转写。语言自动检测,不需要你设置。

会标注说话人吗?

会。每一轮都会归到一个说话人,你可以把说话人 1、说话人 2 改成真名。单人录音不显示标签。

支持哪些格式和时长?

MP3、WAV、M4A 和 OGG,单个文件最大 50 MB、最长三十分钟。导出格式为纯文本、带时间戳的文本、SRT 和 VTT。

准确率如何?

一两个人的清晰录音,接近一个认真听写的人写下的结果。背景噪音、麦克风太远、多人抢话会降低准确率。先清理音频比什么都管用,转完后搜一遍名字能解决剩下的大部分。

能转写视频吗?

暂时不能直接处理。先把视频的音轨导出为 MP3 或 WAV 上传,再用 SRT 导出给视频加字幕。

这和手机上的语音转文字一样吗?

不一样。手机上的语音转文字在你说话时打字,只能实时用。这里转写的是你已有的录音,带时间戳和说话人标签,还能点击任一段落听它。

AI 语音转文字 — 带时间戳和说话人的音频转写