基于注视增强的三方对话中的多模态轮次预测
人机交互
2025-05-30 v3
摘要
轮次预测对于实现无缝交互至关重要。本研究提出一种新型轻量级框架,用于准确预测三方对话中的轮次预测,而无需依赖计算密集型方法。不同于先前方法要么忽视注视,要将其作为被动信号,我们的模型将注视与说话人定位集成,并将其结构化地置于空间约束中,以将其转化为可靠的预测线索。利用以人为主导的行为线索,我们的实验表明,仅整合单用户的注视数据即可显著提升预测性能,而来自多个用户的注视数据进一步通过捕捉更丰富的对话动态来增强性能。该研究提出一种轻量级且注隐私的方法,以支持自适应的、方向性的声音控制,提升嘈杂环境下的语音可理解性,特别适用于智能眼镜的听力辅助。
引用
@article{arxiv.2505.13688,
title = {Gaze-Enhanced Multimodal Turn-Taking Prediction in Triadic Conversations},
author = {Seongsil Heo and Calvin Murdock and Michael Proulx and Christi Miller},
journal= {arXiv preprint arXiv:2505.13688},
year = {2025}
}
备注
To appear in the Proceedings of Interspeech 2025