人声分离
登录

AI 人声分离

上传一段录音,把人声从噪音里抽出来。音乐、风声、车流和回声统统去掉,你说的每个字原样保留。

MP3、WAV 或 M4A · 最长 15 分钟

仅人声上传完成后显示消耗

上传即表示你确认拥有该录音的权利,或已获得处理授权。

适用于说话类录音。如需从歌曲中分离人声与伴奏,请使用人声伴奏分离

Premium人声分离功能面向付费套餐开放。
处理前
处理后

点击任一音轨在同一时刻切换。你的结果就会是这个样子。

01为什么要分离

为什么用人声分离,而不是重录一遍

采访、外景配音和远程通话有一个共同的问题:你想要的那条,就是你已经录到的那条。人声分离工具正是为这种情况而存在。它抢救现有录音,而不是要求你再录一次。

回不去的那一条

嘉宾已经离开,场景已经拆掉,或者情绪刚好但空调一直在响。重录不只花时间,还会丢掉那次表演本身。人声分离保留你说的内容,去掉房间加进去的东西。

让后续每一步都更干净

干净的人声轨不只是好听。字幕识别更准,声音克隆的样本能克隆得更像,变声工具也更少把噪音误判成语音。先跑一遍人声分离,后面每一步都会更好。

什么情况下还是该重录

降噪只能处理麦克风录到的内容。如果人声本身削波、两个人同时说话,或者说话人比车流还小声,再好的分离工具也找不回从未录下的东西。这些情况请重录。

无需安装

AI 人声分离直接在浏览器中运行。没有插件、没有桌面软件、没有音频驱动。

任何设备都能用

Windows、macOS、Linux、iPad 或手机。只要能打开网页、读取文件,就能分离人声。

表演完整保留

节奏、呼吸和重音原封不动,只有背景被去掉。

02基础概念

什么是人声分离?

人声分离(voice isolator)是一种 AI 工具,它把录音中的人声与其他一切声音分开——音乐、风声、车流、键盘敲击、房间回声——并输出一条只含人声的干净音轨。与噪声门或均衡器不同,它识别的是人声本身,而不是切掉某些频段。

人声分离 vs. 降噪滤波器

降噪滤波器按频率工作。它找到嘶声或嗡鸣所在的频段,然后把它们压低。问题在于人声也住在那些频段里,于是齿音变闷,词尾也跟着噪音一起被切掉。

人声分离学过人声长什么样,按内容而非频率来分离。这就是它能去掉背景音乐的原因——音乐与人声的频段几乎完全重叠,滤波器对此无能为力。

人声分离 vs. 消音工具

两者做的是相反的事。消音工具(vocal remover)把歌曲里的演唱去掉、留下伴奏,用于 K 歌和翻唱。人声分离把说话声留下、去掉其他一切,用于播客、视频和配音。

你需要哪一个?

如果你要的是说话的人,这个页面就是对的工具。如果你要的是没有歌手的歌曲,请去找消音工具。

03使用方法

三步分离人声

整个流程都在这个页面的浏览器里完成。不用安装,没有排队,也没有藏在另一个页面后面的导出步骤。

  1. 1

    上传或录音

    拖入 MP3、WAV 或 M4A 文件,或直接用麦克风录制。最长支持十五分钟。上传完成的那一刻,时长和积分消耗就会显示出来。

  2. 2

    分离

    点击「分离人声」。处理时间通常只是录音时长的一小部分。处理期间,波形会从左到右逐渐变干净,你能在听到之前先看到噪音底线消失。

  3. 3

    对比并下载

    两条音轨出现在同一根播放头下:原始录音和纯人声。随时切换,听清到底改变了什么,然后把分离出的人声下载为 MP3。

支持的格式与限制

MP3、WAV、M4A 和 OGG,单个文件最大 50 MB、最长十五分钟,输出为 MP3。上限让处理时间和消耗可预期;更长的素材请在自然停顿处分段,逐段分离。

04先听为准

下载之前,先听出差别

大多数人声分离工具给你一个下载链接,把判断留给你,于是你得开两个播放器来回拖。这里,原始录音和结果并排在同一根播放头下。

一根播放头,两条音轨

点击任一音轨,另一条会从同一秒接着播放,不会从头开始。这是判断人声分离去掉了什么、留下了什么最快的办法。

该听什么

检查三件事:呼吸声和齿音还在、句尾没有被缩短、房间感消失了。最后一条起初可能有点不习惯,但那是正确的。

句中切换

在你关心的那个词上直接在原始与分离之间跳转,而不是从片段开头重听。

听满意了再下载

积分花在分离上,不花在试听上。保存之前你想对比多久都可以。

05使用场景

能清理哪些录音

人声分离能处理任何「说话 + 你不想要的东西」的录音。下面是最常见的四种情况。

播客与采访录音

空调、窗外的街噪、桌下的键盘、隔壁房间的电视。分离人声之后,整期节目听起来像在录音棚里录的。

外景拍摄的视频配音

风声、车流和人群嗡鸣是户外拍摄的一部分。人声分离把它们从对白里去掉,你不必回棚重念。

克隆前的声音样本

克隆的干净程度取决于它学习的样本。先分离人声,再用结果克隆你的声音。克隆学到的是你的声音,而不是你的房间。

旧录音或电话音质

语音留言、存档采访、会议录音。它无法还原从未录下的频段,但能去掉压在上面的噪音。

它做不到的事

它不能拆开两个同时说话的人,不能找回被淹没的词,也不是实时通话功能。人声分离处理的是你已有的录音。

06对比

人声分离 vs. 消音工具 vs. 降噪滤波器

这三个名字经常被混用,但它们解决的是不同的问题。一张表说清楚。

人声分离消音工具降噪滤波器 / EQ
输出仅人声伴奏,人声已去除同一音频,部分频段被切
针对说话歌曲任意
原理识别人声识别人声切除频率
保留呼吸与齿音常被切掉
去除说话背后的音乐
适合播客、视频、配音、克隆样本K 歌、翻唱轻微底噪

如果说话背后有音乐,只有前两类能处理,而只有人声分离会把人声还给你。

07最佳实践

拿到最干净的结果

AI 人声分离大部分工作都自己完成。三个习惯能让输出明显更好。

为什么分离后的音轨会显得「太干净」

房间氛围会和噪音一起被去掉,因为对模型来说它就是噪音。如果某个场景需要空间感,在剪辑软件里把原始音轨以约 -20 dB 混回分离出的人声下面。你得到空间感,却没有嗡鸣。

给它完整的录音

模型需要几秒钟的上下文来学习噪音长什么样。上传前剪得太紧只会让任务更难。

开头留一秒静音

文件开头一小段纯噪音,是人声分离能拿到的最好参照。

不要预先处理

已经压缩、门限或重度 EQ 过的音频,会被当成受损的语音。上传原始文件,让分离只发生一次。

08常见问题

常见问题

哪些套餐包含人声分离?

所有付费套餐,按音频分钟数扣积分,费率与 AI 变声相同。免费账户可以上传文件并查看消耗,但处理需要订阅。每分钟费率请见定价页。

什么是人声分离?

人声分离是把录音中的说话声与其他所有声音(如音乐、车流或房间回声)分开、只保留人声的过程。与均衡器不同,它识别的是人声本身,而不是切掉频段。

它能去掉人声背后的音乐吗?

能。背景音乐正是频率滤波器处理不了、而人声分离可以处理的情况。输出的是人声而不是音乐;如果你要的是伴奏,需要的是消音工具。

它会切掉呼吸声、齿音或词尾吗?

不会。保留这些正是它与降噪滤波器的主要区别。如果你在结果里听到某个词提前结束,几乎总是因为原始录音在那个位置人声已经被淹没了。

支持哪些格式和时长?

MP3、WAV、M4A 和 OGG,单个文件最大 50 MB、最长十五分钟。分离出的人声以 MP3 下载。

可以用分离出的人声来克隆我的声音吗?

可以,而且这是准备样本的最佳方式。干净的人声轨让克隆学到你的声音,而不是房间的噪音。分离完成后,点击「去克隆」即可继续。

这和 iPhone 上的「人声突显」一样吗?

不一样。iPhone 的人声突显是通话时的实时麦克风模式,在你说话时生效。这里的人声分离处理的是你已有的录音,可在任何有浏览器的设备上使用,还能去掉音乐,而手机设置做不到这一点。

我的录音会被保存吗?

分离结果会保存到你的历史记录,方便之后播放或下载,你随时可以删除。上传的源文件仅用于处理,不会保留。

AI 人声分离 — 在线去除录音中的背景噪音与音乐