中文

使用语言、声学和视觉信号预测人机对话中的轮次转移和背通

计算与语言 2025-05-21 v2 人工智能

摘要

本文解决了在人机对话中预测轮次转移和背通动作的多模态信号(语言、声学和视觉)之间的差距。为克服现有数据集的局限性,我们提出了自动数据收集管道,使我们能够收集并标注超过210小时的人类对话视频。从而构建了包含150万词语及相应轮次转移和背通标注的Multi-Modal Face-to-Face(MM-F2F)人类对话数据集,标注来自约200万帧。此外,我们提出了一个端到端框架,从多模态信号预测轮次转移和背通动作的概率。该模型强调模态之间的相互关系,支持任何文本、音频和视频输入的组合,使其适用于各种现实场景。我们的实验表明,我们的方法在轮次转移和背通预测任务上实现了最先进的性能,在轮次转移上F1分数提升10%,在背通预测上提升33%。我们的数据集和代码已公开于在线平台,以便后续研究。

关键词

引用

@article{arxiv.2505.12654,
  title  = {Predicting Turn-Taking and Backchannel in Human-Machine Conversations Using Linguistic, Acoustic, and Visual Signals},
  author = {Yuxin Lin and Yinglin Zheng and Ming Zeng and Wangzheng Shi},
  journal= {arXiv preprint arXiv:2505.12654},
  year   = {2025}
}

备注

Accepected by ACL 2025