语音 LLM 下直译语音到文本翻译:是否优于 CoT 提示?
计算与语言
2026-04-30 v2 声音
摘要
近期针对语音到文本翻译 (S2TT) 的研究聚焦于基于 LLM 的模型,引入日益流行的链式思维 (CoT) 提示法,即模型首先进行语音转文字,再进行翻译。CoT 通常在直接提示法方面取得优势,主要因为它能够利用丰富的自动语音识别 (ASR) 和文本到文本翻译 (T2TT) 数据集,显式地建模其处理步骤。本文系统比较了在不同数据规模下 CoT 与直接提示两种方法的效果。为此,我们对 ASR 语料进行伪标记,通过将其转录文本翻译成六种欧洲语言,然后在不同数据规模下训练基于 LLM 的 S2TT 系统。我们的结果表明,随着数据量的增加,直接提示法的改进更为稳定,这表明在更大规模的 S2TT 资源被创建时,直译方法可能更为有效。
引用
@article{arxiv.2510.03093,
title = {Revisiting Direct Speech-to-Text Translation with Speech LLMs: Better Scaling than CoT Prompting?},
author = {Oriol Pareras and Gerard I. Gállego and Federico Costa and Cristina España-Bonet and Javier Hernando},
journal= {arXiv preprint arXiv:2510.03093},
year = {2026}
}
备注
To appear in Proc. ICASSP 2026, May 04-08, 2026, Barcelona, Spain