AI 人声分离
上传一段录音,把人声从噪音里抽出来。音乐、风声、车流和回声统统去掉,你说的每个字原样保留。
MP3、WAV 或 M4A · 最长 15 分钟
上传即表示你确认拥有该录音的权利,或已获得处理授权。
适用于说话类录音。如需从歌曲中分离人声与伴奏,请使用人声伴奏分离。
点击任一音轨在同一时刻切换。你的结果就会是这个样子。
01—为什么要分离
为什么用人声分离,而不是重录一遍
采访、外景配音和远程通话有一个共同的问题:你想要的那条,就是你已经录到的那条。人声分离工具正是为这种情况而存在。它抢救现有录音,而不是要求你再录一次。
回不去的那一条
嘉宾已经离开,场景已经拆掉,或者情绪刚好但空调一直在响。重录不只花时间,还会丢掉那次表演本身。人声分离保留你说的内容,去掉房间加进去的东西。
让后续每一步都更干净
干净的人声轨不只是好听。字幕识别更准,声音克隆的样本能克隆得更像,变声工具也更少把噪音误判成语音。先跑一遍人声分离,后面每一步都会更好。
什么情况下还是该重录
降噪只能处理麦克风录到的内容。如果人声本身削波、两个人同时说话,或者说话人比车流还小声,再好的分离工具也找不回从未录下的东西。这些情况请重录。
无需安装
AI 人声分离直接在浏览器中运行。没有插件、没有桌面软件、没有音频驱动。
任何设备都能用
Windows、macOS、Linux、iPad 或手机。只要能打开网页、读取文件,就能分离人声。
表演完整保留
节奏、呼吸和重音原封不动,只有背景被去掉。
02—基础概念
什么是人声分离?
人声分离(voice isolator)是一种 AI 工具,它把录音中的人声与其他一切声音分开——音乐、风声、车流、键盘敲击、房间回声——并输出一条只含人声的干净音轨。与噪声门或均衡器不同,它识别的是人声本身,而不是切掉某些频段。
人声分离 vs. 降噪滤波器
降噪滤波器按频率工作。它找到嘶声或嗡鸣所在的频段,然后把它们压低。问题在于人声也住在那些频段里,于是齿音变闷,词尾也跟着噪音一起被切掉。
人声分离学过人声长什么样,按内容而非频率来分离。这就是它能去掉背景音乐的原因——音乐与人声的频段几乎完全重叠,滤波器对此无能为力。
人声分离 vs. 消音工具
两者做的是相反的事。消音工具(vocal remover)把歌曲里的演唱去掉、留下伴奏,用于 K 歌和翻唱。人声分离把说话声留下、去掉其他一切,用于播客、视频和配音。
你需要哪一个?
如果你要的是说话的人,这个页面就是对的工具。如果你要的是没有歌手的歌曲,请去找消音工具。
03—使用方法
三步分离人声
整个流程都在这个页面的浏览器里完成。不用安装,没有排队,也没有藏在另一个页面后面的导出步骤。
- 1
上传或录音
拖入 MP3、WAV 或 M4A 文件,或直接用麦克风录制。最长支持十五分钟。上传完成的那一刻,时长和积分消耗就会显示出来。
- 2
分离
点击「分离人声」。处理时间通常只是录音时长的一小部分。处理期间,波形会从左到右逐渐变干净,你能在听到之前先看到噪音底线消失。
- 3
对比并下载
两条音轨出现在同一根播放头下:原始录音和纯人声。随时切换,听清到底改变了什么,然后把分离出的人声下载为 MP3。
支持的格式与限制
MP3、WAV、M4A 和 OGG,单个文件最大 50 MB、最长十五分钟,输出为 MP3。上限让处理时间和消耗可预期;更长的素材请在自然停顿处分段,逐段分离。
04—先听为准
下载之前,先听出差别
大多数人声分离工具给你一个下载链接,把判断留给你,于是你得开两个播放器来回拖。这里,原始录音和结果并排在同一根播放头下。
一根播放头,两条音轨
点击任一音轨,另一条会从同一秒接着播放,不会从头开始。这是判断人声分离去掉了什么、留下了什么最快的办法。
该听什么
检查三件事:呼吸声和齿音还在、句尾没有被缩短、房间感消失了。最后一条起初可能有点不习惯,但那是正确的。
句中切换
在你关心的那个词上直接在原始与分离之间跳转,而不是从片段开头重听。
听满意了再下载
积分花在分离上,不花在试听上。保存之前你想对比多久都可以。
05—使用场景
能清理哪些录音
人声分离能处理任何「说话 + 你不想要的东西」的录音。下面是最常见的四种情况。
播客与采访录音
空调、窗外的街噪、桌下的键盘、隔壁房间的电视。分离人声之后,整期节目听起来像在录音棚里录的。
外景拍摄的视频配音
风声、车流和人群嗡鸣是户外拍摄的一部分。人声分离把它们从对白里去掉,你不必回棚重念。
克隆前的声音样本
克隆的干净程度取决于它学习的样本。先分离人声,再用结果克隆你的声音。克隆学到的是你的声音,而不是你的房间。
旧录音或电话音质
语音留言、存档采访、会议录音。它无法还原从未录下的频段,但能去掉压在上面的噪音。
它做不到的事
它不能拆开两个同时说话的人,不能找回被淹没的词,也不是实时通话功能。人声分离处理的是你已有的录音。
06—对比
人声分离 vs. 消音工具 vs. 降噪滤波器
这三个名字经常被混用,但它们解决的是不同的问题。一张表说清楚。
| 人声分离 | 消音工具 | 降噪滤波器 / EQ | |
|---|---|---|---|
| 输出 | 仅人声 | 伴奏,人声已去除 | 同一音频,部分频段被切 |
| 针对 | 说话 | 歌曲 | 任意 |
| 原理 | 识别人声 | 识别人声 | 切除频率 |
| 保留呼吸与齿音 | 常被切掉 | ||
| 去除说话背后的音乐 | |||
| 适合 | 播客、视频、配音、克隆样本 | K 歌、翻唱 | 轻微底噪 |
如果说话背后有音乐,只有前两类能处理,而只有人声分离会把人声还给你。
07—最佳实践
拿到最干净的结果
AI 人声分离大部分工作都自己完成。三个习惯能让输出明显更好。
为什么分离后的音轨会显得「太干净」
房间氛围会和噪音一起被去掉,因为对模型来说它就是噪音。如果某个场景需要空间感,在剪辑软件里把原始音轨以约 -20 dB 混回分离出的人声下面。你得到空间感,却没有嗡鸣。
给它完整的录音
模型需要几秒钟的上下文来学习噪音长什么样。上传前剪得太紧只会让任务更难。
开头留一秒静音
文件开头一小段纯噪音,是人声分离能拿到的最好参照。
不要预先处理
已经压缩、门限或重度 EQ 过的音频,会被当成受损的语音。上传原始文件,让分离只发生一次。
08—常见问题
常见问题
哪些套餐包含人声分离?
所有付费套餐,按音频分钟数扣积分,费率与 AI 变声相同。免费账户可以上传文件并查看消耗,但处理需要订阅。每分钟费率请见定价页。
什么是人声分离?
人声分离是把录音中的说话声与其他所有声音(如音乐、车流或房间回声)分开、只保留人声的过程。与均衡器不同,它识别的是人声本身,而不是切掉频段。
它能去掉人声背后的音乐吗?
能。背景音乐正是频率滤波器处理不了、而人声分离可以处理的情况。输出的是人声而不是音乐;如果你要的是伴奏,需要的是消音工具。
它会切掉呼吸声、齿音或词尾吗?
不会。保留这些正是它与降噪滤波器的主要区别。如果你在结果里听到某个词提前结束,几乎总是因为原始录音在那个位置人声已经被淹没了。
支持哪些格式和时长?
MP3、WAV、M4A 和 OGG,单个文件最大 50 MB、最长十五分钟。分离出的人声以 MP3 下载。
可以用分离出的人声来克隆我的声音吗?
可以,而且这是准备样本的最佳方式。干净的人声轨让克隆学到你的声音,而不是房间的噪音。分离完成后,点击「去克隆」即可继续。
这和 iPhone 上的「人声突显」一样吗?
不一样。iPhone 的人声突显是通话时的实时麦克风模式,在你说话时生效。这里的人声分离处理的是你已有的录音,可在任何有浏览器的设备上使用,还能去掉音乐,而手机设置做不到这一点。
我的录音会被保存吗?
分离结果会保存到你的历史记录,方便之后播放或下载,你随时可以删除。上传的源文件仅用于处理,不会保留。
09—下一步
用干净的人声做更多事
干净的人声只是起点。AnyVoice 上的每个工具都会因此表现更好。