说话人分离
Speaker diarization:软件怎样知道谁在什么时候说话
Speaker diarization(说话人分离)是把一段录音按照不同说话人切分的过程。简单来说,语音转文字回答“说了什么”,diarization 回答“谁在什么时候说”。
它和语音转文字解决不同问题
语音识别把声音变成文字;diarization 把这些文字进一步归到说话人1、说话人2。两者结合后,长文字稿才真正像一段对话。
说话人识别再多走一步
Diarization 能知道两个声音不是同一个人,但并不知道名字。说话人识别会把声音和已知人物关联,比如你以前给某个声音命名为 Alice,下一次就可以再次认出来。
为什么会议和访谈很需要它
决定、引用和行动项往往取决于是谁说的。说话人标签可以让你更快核对发言、整理访谈和理解多人讨论。
它并不完美
同时说话、麦克风太远、背景噪声、声音很相似都会造成错误。好的应用应该允许你重命名、合并和重新指定说话人。