SpeechDPR:面向开放域口语问答的端到端口语段落检索
计算与语言
2024-08-27 v3 信息检索
声音
音频与语音处理
摘要
口语问答(SQA)对于机器通过在给定的口语段落中寻找答案区间来回答用户的问题至关重要。此前 SQA 在不使用 ASR 的情况下实现,以避免识别错误和词表外(OOV)问题。然而,开放域 SQA(openSQA)的现实问题,即机器还需要首先从口语档案库中检索可能包含答案的段落,却从未被考虑过。本文提出了首个用于 openSQA 问题检索组件的端到端框架,即语音密集段落检索器(SpeechDPR)。SpeechDPR 通过从无监督 ASR(UASR)和文本密集检索器(TDR)的级联模型中蒸馏知识,学习句子级语义表示。不需要手动转录的语音数据。初步实验表明,其性能与 UASR 和 TDR 的级联模型相当,并且在 UASR 较差时显著更好,验证了该方法对语音识别错误具有更强的鲁棒性。
引用
@article{arxiv.2401.13463,
title = {SpeechDPR: End-to-End Spoken Passage Retrieval for Open-Domain Spoken Question Answering},
author = {Chyi-Jiunn Lin and Guan-Ting Lin and Yung-Sung Chuang and Wei-Lun Wu and Shang-Wen Li and Abdelrahman Mohamed and Hung-yi Lee and Lin-shan Lee},
journal= {arXiv preprint arXiv:2401.13463},
year = {2024}
}
备注
Accepted at ICASSP 2024