話者ダイアライゼーション

話者ダイアライゼーション:誰がいつ話したかを判別する仕組み

話者ダイアライゼーションとは、録音を話者ごとに分ける処理です。簡単に言えば、文字起こしが「何を言ったか」、ダイアライゼーションが「誰がいつ話したか」に答えます。

文字起こしとは役割が違う

音声認識は音を文字に変換します。ダイアライゼーションはその文字を話者1、話者2のように分け、会話として読みやすくします。

話者認識はさらに一歩進む

ダイアライゼーションは二つの声が別人だと判断できますが名前は知りません。話者認識は過去に名前を付けた声と結び付け、例えば「話者2は田中さん」と認識します。

会議やインタビューで重要な理由

決定事項や引用は誰が言ったかで意味が変わります。話者ラベルがあると発言確認やインタビュー整理が速くなります。

完全ではない

同時発話、遠いマイク、騒音、似た声では誤りが起きます。話者名の変更、統合、再割り当てができることが重要です。

次の会話から、始めましょう。

Murmur をダウンロードし、音声モデルを一度取得すれば、それ以降の録音はすべて手元の端末で文字起こしされます——会議も、インタビューも、講義も、散歩中の思いつきも。

ダウンロード無料 · アカウント不要 · 電波がなくても動作

iPhone・iPad の無料版では、各録音の最初の 20 分を文字起こしできます。Murmur Pro は買い切りで、この制限を解除します。Android 版は現在、録音時間の制限なく無料で文字起こしできます。