中文

PROST-LLM:逐步增强大语言模型的语音到语音翻译能力

计算与语言 2026-01-26 v1

摘要

尽管大语言模型(LLMs)在许多任务中表现出色,但其在语音到语音翻译(S2ST)中的应用尚未得到充分探索,并受到数据稀缺的阻碍。为弥补这一差距,我们提出了PROST-LLM(逐步语音到语音翻译),以逐步增强LLMs的S2ST能力。首先,我们使用CVSS语料库对LLMs进行微调,采用设计的三任务学习和模态链方法来提升初始性能。然后,利用微调后的模型,通过自采样和反向翻译生成偏好对,无需人工评估。最后,这些偏好对被用于偏好优化,以进一步增强模型的S2ST能力。大量实验证实了我们提出的PROST-LLM在提升LLMs的S2ST能力方面的有效性。

关键词

引用

@article{arxiv.2601.16618,
  title  = {PROST-LLM: Progressively Enhancing the Speech-to-Speech Translation Capability in LLMs},
  author = {Jing Xu and Jiaqi Wang and Daxin Tan and Xiao Chen},
  journal= {arXiv preprint arXiv:2601.16618},
  year   = {2026}
}

备注

Accepted by ICASSP 2026