听、注视、理解:面向高方差标签的端到端语音翻译训练的正则化技术
计算与语言
2026-01-06 v1
摘要
端到端语音翻译(E2E-ST)常常在目标转录抖动大且语义模糊时表现较差。我们提出Listen, Attend, Understand(LAU),这是一种语义正则化技术,通过约束训练期间声学编码器的潜在空间来实现。我们利用冻结文本嵌入提供方向性辅助损失,LAU在不增加推理成本的前提下,将语言 grounding 注入声学表示。我们在一个30小时的巴马巴语到法语数据集上进行评估,该数据集由非专业人员翻译。实验结果表明,LAU模型在标准指标上表现与使用100%更多数据预训练的E2E-ST系统相当,同时在保持语义含义方面表现更好。此外,我们引入了总参数漂移(Total Parameter Drift)指标来量化正则化对结构性影响,表明语义约束主动重组编码器的权重,以优先考虑意义而非字面音素。我们的发现表明,LAU是端到端语音翻译训练中稳健的替代方案,尤其适用于数据稀缺和/或噪声较大的情境。
引用
@article{arxiv.2601.01121,
title = {Listen, Attend, Understand: a Regularization Technique for Stable E2E Speech Translation Training on High Variance labels},
author = {Yacouba Diarra and Michael Leventhal},
journal= {arXiv preprint arXiv:2601.01121},
year = {2026}
}
备注
9 mages, 3 figures