面向端到端自动语音识别与语音翻译:语音基础模型与大语言模型的集成
计算与语言
2025-10-14 v1
摘要
语音翻译(ST)是一种将语音信号从一种语言转换为另一种语言对应文本的机器翻译任务;该任务包含两种不同的方法,即传统的级联方法和更近期的端到端方法。本文探索了将预训练语音编码器与大语言模型(LLMs)组合的端到端架构,用于同时执行自动语音识别(ASR)和ST。针对英语到德语语言对进行实验,结果表明,我们的最佳模型不仅能优于SeamlessM4T——一个大型端到端、多模态翻译模型,还能与级联系统中的Whisper和NLLB保持一致性能,在指标上实现最高8%的得分提升。
引用
@article{arxiv.2510.10329,
title = {End-to-end Automatic Speech Recognition and Speech Translation: Integration of Speech Foundational Models and LLMs},
author = {Nam Luu and Ondřej Bojar},
journal= {arXiv preprint arXiv:2510.10329},
year = {2025}
}