中文

用于人机对话中话轮转换预测的带对比学习的门控多模态融合

音频与语音处理 2022-04-22 v1 人工智能 计算与语言

摘要

话轮转换旨在决定下一说话者何时可以开始说话,是构建人机语音对话系统的关键组成部分。先前研究表明多模态线索可助力这一具挑战性的任务。然而,由于公开多模态数据集的匮乏,当前方法大多局限于使用单模态特征或简单的多模态集成模型。此外,真实场景固有的类别不平衡(例如以短暂停顿结尾的句子多被视作话轮结束)也对话轮转换决策带来巨大挑战。本文中,我们首先收集了包含 5000 余段语音与文本模态真实人机对话的大规模标注语料用于话轮转换。随后,设计了一种新颖的门控多模态融合机制,以无缝利用各类信息用于话轮转换预测。更重要的是,为应对数据不平衡问题,我们设计了一种简单而有效的无监督数据增强方法构造负例,并应用对比学习获得更好的特征表示。我们进行了充分实验,结果证明了我们的模型相对于若干 SOTA 基线的优越性与竞争力。

关键词

引用

@article{arxiv.2204.10172,
  title  = {Gated Multimodal Fusion with Contrastive Learning for Turn-taking Prediction in Human-robot Dialogue},
  author = {Jiudong Yang and Peiying Wang and Yi Zhu and Mingchao Feng and Meng Chen and Xiaodong He},
  journal= {arXiv preprint arXiv:2204.10172},
  year   = {2022}
}

备注

Accepted by ICASSP 2022