中文

端到端口语对话问答:任务、数据集与模型

计算与语言 2022-05-02 v1 人工智能 声音 音频与语音处理

摘要

在口语问答中,系统设计为从相关语音转写文本中的连续文本跨度回答问题。然而,人类寻求或检验知识最自然的方式是通过人机对话。因此,我们提出了一种新的口语对话问答任务(SCQA),旨在使系统能够基于语音文档对复杂对话流进行建模。在该任务中,我们的主要目标是构建基于音频录音处理对话式问题、并探索通过不同模态提供更多信息线索以辅助系统信息收集的可行性。为此,我们没有直接采用具有高度噪声的自动生成语音转写,而是提出了一种新颖的统一数据蒸馏方法DDNet,其有效吸收跨模态信息以实现语音与语言模态的细粒度表示。此外,我们提出了一种简单而新颖的机制,称为双重注意力(Dual Attention),通过促进音频与文本之间更好的对齐来简化知识迁移过程。为评估SCQA系统在对话式交互中的能力,我们构建了口语对话问答(Spoken-CoQA)数据集,包含来自4k段对话的超过40k问答对。现有最先进方法的性能在我们的数据集上显著下降,从而证明了跨模态信息整合的必要性。我们的实验结果表明,所提方法在口语对话问答任务中取得了优越性能。

关键词

引用

@article{arxiv.2204.14272,
  title  = {End-to-end Spoken Conversational Question Answering: Task, Dataset and Model},
  author = {Chenyu You and Nuo Chen and Fenglin Liu and Shen Ge and Xian Wu and Yuexian Zou},
  journal= {arXiv preprint arXiv:2204.14272},
  year   = {2022}
}

备注

In Findings of NAACL 2022. arXiv admin note: substantial text overlap with arXiv:2010.08923