中文

结合音素增强思维链的语音到文本翻译:增强低资源场景下的跨语言迁移

计算与语言 2025-09-30 v1 声音 音频与语音处理

摘要

我们提出了一种语音到文本翻译(S2TT)方法,该方法将音素表示集成到思维链(CoT)框架中,以改善低资源和零资源场景下的翻译。通过引入音素识别作为中间步骤,我们增强了跨语言迁移,甚至能够对没有标注语音数据的语言进行翻译。我们的系统建立在多语言 LLM 之上,并将其扩展以处理语音和音素。训练遵循课程学习策略,逐步引入更复杂的任务。在多语言 S2TT 基准上的实验表明,音素增强的 CoT 提高了低资源条件下的翻译质量并实现了零资源翻译,同时略微影响了高资源场景下的性能。尽管存在这种权衡,我们的研究结果表明,基于音素的 CoT 是使 S2TT 在多样化语言中更易获取的有前景的一步。

关键词

引用

@article{arxiv.2505.24691,
  title  = {Speech-to-Text Translation with Phoneme-Augmented CoT: Enhancing Cross-Lingual Transfer in Low-Resource Scenarios},
  author = {Gerard I. Gállego and Oriol Pareras and Martí Cortada Garcia and Lucas Takanori and Javier Hernando},
  journal= {arXiv preprint arXiv:2505.24691},
  year   = {2025}
}

备注

Accepted at Interspeech 2025