说话人分离

Speaker diarization:软件怎样知道谁在什么时候说话

Speaker diarization(说话人分离)是把一段录音按照不同说话人切分的过程。简单来说,语音转文字回答“说了什么”,diarization 回答“谁在什么时候说”。

它和语音转文字解决不同问题

语音识别把声音变成文字;diarization 把这些文字进一步归到说话人1、说话人2。两者结合后,长文字稿才真正像一段对话。

说话人识别再多走一步

Diarization 能知道两个声音不是同一个人,但并不知道名字。说话人识别会把声音和已知人物关联,比如你以前给某个声音命名为 Alice,下一次就可以再次认出来。

为什么会议和访谈很需要它

决定、引用和行动项往往取决于是谁说的。说话人标签可以让你更快核对发言、整理访谈和理解多人讨论。

它并不完美

同时说话、麦克风太远、背景噪声、声音很相似都会造成错误。好的应用应该允许你重命名、合并和重新指定说话人。

从你的下一段对话开始。

下载 Murmur,下载一次语音模型,之后的每一次录音都会在你自己的设备上完成转写——会议、访谈、课堂,还有散步时的灵感。

免费下载 · 无需账号 · 没信号也能用

iPhone 和 iPad 免费版可转写每段录音的前 20 分钟;一次性购买 Murmur Pro 即可解除限制。Android 版目前免费转写,且不限制单段录音时长。