DUAL:面向无文本语音问答的离散语音单元自适应学习
计算与语言
2022-06-22 v3 声音
音频与语音处理
摘要
语音问答(SQA)是指在给定问题的情况下从语音文档中找到答案,这对于个人助手在回复用户查询时至关重要。现有的 SQA 方法均依赖自动语音识别(ASR)转录文本。ASR 不仅需要使用大量标注数据进行训练,这对于低资源语言而言收集成本和时间都难以承受,而且更重要的是,问题的答案往往包含无法被正确识别的命名实体或词外词。此外,ASR 旨在对所有词(包括许多与 SQA 任务无关的虚词)均等地最小化识别错误。因此,尽管已知非常困难,但无 ASR 转录文本(无文本)的 SQA 始终备受期待。本工作提出了离散语音单元自适应学习(DUAL),利用未标注数据进行预训练,并由 SQA 下游任务进行微调。语音答案的时间间隔可以直接从语音文档中预测出来。我们还发布了一个新的 SQA 基准语料库 NMSQA,用于包含更真实场景的数据。我们通过实验表明,DUAL 产生的结果可与级联 ASR 和文本 QA 模型获得的结果相媲美,并且对真实世界数据具有鲁棒性。我们的代码和模型将开源。
引用
@article{arxiv.2203.04911,
title = {DUAL: Discrete Spoken Unit Adaptive Learning for Textless Spoken Question Answering},
author = {Guan-Ting Lin and Yung-Sung Chuang and Ho-Lam Chung and Shu-wen Yang and Hsuan-Jui Chen and Shuyan Dong and Shang-Wen Li and Abdelrahman Mohamed and Hung-yi Lee and Lin-shan Lee},
journal= {arXiv preprint arXiv:2203.04911},
year = {2022}
}
备注
Accepted by Interspeech 2022