REINA:用于高效同步语音翻译的正则化熵信息损失
机器学习
2025-12-08 v3 计算与语言
音频与语音处理
摘要
同步语音翻译(SimulST)系统在流式输入音频的同时发射翻译后的文本或语音。此类系统面临着在翻译质量和延迟之间进行权衡的重大挑战。我们提出一种优化这一权衡策略:仅在获取更多输入信息后才等待。基于此策略,我们提出了正则化熵信息适应(REINA),一种用于训练适应性策略的新型损失函数,该策略基于现有的非流式翻译模型。我们从信息论原理出发推导 REINA,并表明 REINA 在推进延迟/质量权衡的帕累托前沿方面优于先前方法。利用 REINA,我们在法语、西班牙语和德语上训练 SimulST 模型,均从英语进行翻译。仅使用开源或合成生成的数据,我们实现了相同规模模型的领先流式结果。我们还引入了一种用于衡量流式效率的指标,定量表明 REINA 在延迟/质量权衡方面相较于先前方法可提高最高 21%,以非流式基线 BLEU 分数进行标准化。
引用
@article{arxiv.2508.04946,
title = {REINA: Regularized Entropy Information-Based Loss for Efficient Simultaneous Speech Translation},
author = {Nameer Hirschkind and Joseph Liu and Xiao Yu and Mahesh Kumar Nandwana},
journal= {arXiv preprint arXiv:2508.04946},
year = {2025}
}
备注
Accepted to AAAI 2026 (Oral Track)