中文

用于长篇语音问答的端到端对比语言-语音预训练模型

声音 2026-04-14 v3 计算与语言

摘要

近年来,语音问答(SQA)取得了显著进展。然而,许多现有方法,包括大型音频语言模型,在处理长时音频方面存在挑战。跟随检索增强生成的成功,语音相关检索器在帮助预处理长语音方面显示出前景。但现有语音相关检索器的性能尚不理想。为此,我们提出了CLSR,即一种端到端对比语言-语音检索器,高效地从长时音频录音中提取与问题相关的片段,以适用于下游SQA任务。不同于常规语音-文本对比模型,CLSR包含一个将声学特征转换为类文本表示的中间步骤,从而更有效地弥合跨模态之间的差距。跨模态检索数据集上的实验结果表明,CLSR优于现有的端到端语音检索器和结合语音识别与文本检索的流水线方法,为推动实际的长时SQA应用提供了稳健的基础。

关键词

引用

@article{arxiv.2511.09282,
  title  = {End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering},
  author = {Jiliang Hu and Zuchao Li and Baoyuan Qi and Liu Guoming and Ping Wang},
  journal= {arXiv preprint arXiv:2511.09282},
  year   = {2026}
}

备注

12 pages, 7 figures, accepted by AAAI 2026