用于人机对话中话轮转换预测的带对比学习的门控多模态融合
音频与语音处理
2022-04-22 v1 人工智能
计算与语言
摘要
话轮转换旨在决定下一说话者何时可以开始说话,是构建人机语音对话系统的关键组成部分。先前研究表明多模态线索可助力这一具挑战性的任务。然而,由于公开多模态数据集的匮乏,当前方法大多局限于使用单模态特征或简单的多模态集成模型。此外,真实场景固有的类别不平衡(例如以短暂停顿结尾的句子多被视作话轮结束)也对话轮转换决策带来巨大挑战。本文中,我们首先收集了包含 5000 余段语音与文本模态真实人机对话的大规模标注语料用于话轮转换。随后,设计了一种新颖的门控多模态融合机制,以无缝利用各类信息用于话轮转换预测。更重要的是,为应对数据不平衡问题,我们设计了一种简单而有效的无监督数据增强方法构造负例,并应用对比学习获得更好的特征表示。我们进行了充分实验,结果证明了我们的模型相对于若干 SOTA 基线的优越性与竞争力。
引用
@article{arxiv.2204.10172,
title = {Gated Multimodal Fusion with Contrastive Learning for Turn-taking Prediction in Human-robot Dialogue},
author = {Jiudong Yang and Peiying Wang and Yi Zhu and Mingchao Feng and Meng Chen and Xiaodong He},
journal= {arXiv preprint arXiv:2204.10172},
year = {2022}
}
备注
Accepted by ICASSP 2022