中文

用于口语问答的自监督对比跨模态表示学习

计算与语言 2021-09-09 v1 人工智能 机器学习 声音 音频与语音处理

摘要

口语问答(SQA)需要对口语文档与问题均进行细粒度理解以预测最优答案。本文提出用于口语问答的新颖训练方案,包含自监督训练阶段与对比表示学习阶段。在自监督阶段,我们提出三项辅助自监督任务,包括语句还原、语句插入与问题判别,并联合训练模型以在无任何额外数据或标注下捕捉语音文档间的一致性与连贯性。我们进而提出在对比目标中通过采用多种增强策略(包括跨度删除与跨度替换)学习噪声不变语句表示。此外,我们设计了一种时间对齐注意力,以在所学公共空间中语义对齐语音-文本线索并惠及 SQA 任务。借此,训练方案能更有效地引导生成模型预测更恰当的答案。实验结果表明,我们的模型在三个 SQA 基准上取得了最先进(SOTA)结果。

关键词

引用

@article{arxiv.2109.03381,
  title  = {Self-supervised Contrastive Cross-Modality Representation Learning for Spoken Question Answering},
  author = {Chenyu You and Nuo Chen and Yuexian Zou},
  journal= {arXiv preprint arXiv:2109.03381},
  year   = {2021}
}