中文

基于显式跨模态对齐的语音-文本对话预训练用于口语对话理解

计算与语言 2023-06-12 v2 人工智能

摘要

近年来,语音-文本预训练方法在许多语音和自然语言处理任务中取得了显著成功。然而,大多数先前的预训练模型通常针对一两个特定任务定制,却无法攻克广泛的语音-文本任务。此外,现有的语音-文本预训练方法未能利用对话中的上下文信息来丰富话语表示。在本文中,我们提出了用于口语对话理解、具有显式跨模态对齐的语音-文本对话预训练模型(SPECTRA),这是首个语音-文本对话预训练模型。具体而言,为考虑语音模态的时间性,我们设计了一种新颖的时间位置预测任务来捕捉语音-文本对齐。该预训练任务旨在预测每个文本词在对应语音波形中的起始和结束时间。此外,为学习口语对话的特征,我们将文本对话预训练中的回复选择任务推广到语音-文本对话预训练场景中。在四个不同下游语音-文本任务上的实验结果证明了 SPECTRA 在学习语音-文本对齐和多轮对话上下文方面的优越性。

关键词

引用

@article{arxiv.2305.11579,
  title  = {Speech-Text Dialog Pre-training for Spoken Dialog Understanding with Explicit Cross-Modal Alignment},
  author = {Tianshu Yu and Haoyu Gao and Ting-En Lin and Min Yang and Yuchuan Wu and Wentao Ma and Chao Wang and Fei Huang and Yongbin Li},
  journal= {arXiv preprint arXiv:2305.11579},
  year   = {2023}
}

备注

Accepted at ACL 2023 main conference