结合音素增强思维链的语音到文本翻译:增强低资源场景下的跨语言迁移
计算与语言
2025-09-30 v1 声音
音频与语音处理
摘要
我们提出了一种语音到文本翻译(S2TT)方法,该方法将音素表示集成到思维链(CoT)框架中,以改善低资源和零资源场景下的翻译。通过引入音素识别作为中间步骤,我们增强了跨语言迁移,甚至能够对没有标注语音数据的语言进行翻译。我们的系统建立在多语言 LLM 之上,并将其扩展以处理语音和音素。训练遵循课程学习策略,逐步引入更复杂的任务。在多语言 S2TT 基准上的实验表明,音素增强的 CoT 提高了低资源条件下的翻译质量并实现了零资源翻译,同时略微影响了高资源场景下的性能。尽管存在这种权衡,我们的研究结果表明,基于音素的 CoT 是使 S2TT 在多样化语言中更易获取的有前景的一步。
引用
@article{arxiv.2505.24691,
title = {Speech-to-Text Translation with Phoneme-Augmented CoT: Enhancing Cross-Lingual Transfer in Low-Resource Scenarios},
author = {Gerard I. Gállego and Oriol Pareras and Martí Cortada Garcia and Lucas Takanori and Javier Hernando},
journal= {arXiv preprint arXiv:2505.24691},
year = {2025}
}
备注
Accepted at Interspeech 2025