语音转文本:前置拼接还是交叉注意力?一项实证比较
计算与语言
2025-02-11 v3 声音
音频与语音处理
摘要
鉴于大语言模型(LLMs)在自然语言处理任务中取得的显著成功,将其能力扩展到语音——最常见的交流形式——正引起越来越多的关注。将语音整合到 LLM 中最广泛使用的方法是密集特征前置拼接(Dense Feature Prepending, DFP),即把投影后的语音表示前置拼接到文本表示之前,从而允许使用语音编码器进行端到端训练。这引发了若干问题:DFP 是否需要复杂的语音编码器?其性能与标准的编码器-解码器(即交叉注意力)架构相比如何?我们在多种配置下对 DFP 与交叉注意力进行了比较,包括 CTC 压缩、序列级知识蒸馏,以及在单语、双语与多语模型上的表现。为进行受控的架构比较,我们从零开始训练所有模型,而非使用大规模预训练模型,并采用相当的数据与参数设置,在 MuST-C v1.0 与 CoVoST2 数据集上测试语音转文本识别(ASR)与语音翻译(ST)。尽管 DFP 已被广泛采用,我们的结果并未表明 DFP 相对于交叉注意力具有明显优势。
引用
@article{arxiv.2501.02370,
title = {Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison},
author = {Tsz Kin Lam and Marco Gaido and Sara Papi and Luisa Bentivogli and Barry Haddow},
journal= {arXiv preprint arXiv:2501.02370},
year = {2025}
}
备注
Accepted at NAACL 2025