上周四晚上,我把一段 2 小时的双人采访拖进 Audacity,准备按说话人切成两条音轨。切到第 40 分钟的时候,我盯着波形图上密密麻麻的选区,第一次产生了"要不这期不发了"的念头。慢。真的太慢了。手动找到每一个说话人切换的点,听一遍、标记、裁剪、再对齐,两小时素材我折腾了一整晚。
我去翻那些号称"自动分说话人"的工具,好家伙,大多数只给你一段带时间戳的文本:00:12:34 - 00:15:02 Speaker A。可我要的是音轨文件啊。你告诉我"谁在什么时候说话",最后不还是得我手动去剪?说白了,这类工具只做了"检测",没做"分离"。
后来在 V2EX 上刷到一个帖子,作者自荐了一个叫 Seply 的网页工具。一句话说清楚:把混合录音扔进去,它自动按说话人拆成几条独立的音轨,时间对齐,直接下载 WAV。不用装软件,不用手动剪,网页上全搞定。

项目地址:https://seply.org
我第一次用的时候还闹了个笑话。打开网页,直接把 .wav 拖进上传区,结果页面弹出来一句 Sign in to upload a recording——得,免安装是免安装,登录还是要登录的。注册完再传,这次老实了。它让我选自动检测还是手动标记,我选了自动,然后就看着进度条转。

等了几分钟,结果出来了:两条音轨,Speaker 1 和 Speaker 2,波形图清清楚楚。我点开 Speaker 1 试听,咦,居然真的只剩一个人的声音了,背景里另一个人的声音被"抠"得干干净净。下载下来是 WAV,丢进剪辑软件就能直接用。说实话,这块的 AI 原理我也没完全搞懂,大概就是先识别声纹特征、再做音频分离那一套,细节可能有出入——有懂的大佬欢迎指正。
不过槽点也得说。第一,免费额度只有 30 credits,我这一条 2 小时的音频就用掉大半,想长期用就得订阅,Starter 档 12 美元/月。第二,上传上限 1GB,超长播客或者高码率视频会卡在门口。第三,它只输出 Speaker 1、Speaker 2,不会智能到帮你标出"这是老王,这是小李"——名字还得你自己认。
还有个小问题,网页处理大文件不是实时的,我传完等了大概五六分钟才有结果。你要是赶着发布,得提前算好时间,别指望它秒出。
反正我的结论是:如果你只是偶尔剪一期采访、一期播客,这玩意真的能救命,把最折磨人的分轨环节从一晚上压缩到几分钟;如果你天天剪,12 美元/月换掉两小时手工活,值不值你自己算。我已经把它存进书签了,下期采访录完直接丢给它。
对了,如果你更想自己折腾开源方案,可以看看 Deezer 的 Spleeter(人声/伴奏分离)和 PyAnnote(说话人分离的 Python 库),就是得配环境,没这个网页工具省事。
好了,我去把上周那期采访重新剪一遍,回见。