MMSDS 傾聴顔デモ(FLAME/ロボ子さんV2)

西村良太研究室_音声知能システム研究室
リアクション
2026年08月22日
・MMSDS(マルチモーダル音声対話システム)Listening Head デモ

人が話しかけると,3D顔モデルがリアルタイムに相槌・うなずきを返します.
動画では顔モデルを FLAME(既定)からロボ子さんV2(PMX)へ切り替えています.

画面右上のウォーターフォールは,1ターンの応答が組み上がるまでの内訳
(発話+音声認識 → LLM 文1・文2・文3 → 音声合成 文1・文2・文3)を可視化したもので,
応答開始まで何ミリ秒かかったかをターンごとに確認できます.

※ 本デモの音声認識はブラウザの Web Speech API を使用しています.

豊橋技術科学大学 北岡・西村研究室