基于标签同步的神经转导器用于端到端同时语音翻译
计算与语言
2024-06-10 v1 音频与语音处理
摘要
虽然神经转导器因其在在线语音识别中受到广泛关注,但同时语音翻译需要具备流式处理和序列重排能力。本文提出了一种用于SST的标签同步神经转导器(LS-Transducer-SST),该模型自然具备上述两种特性。LS-Transducer-SST通过自回归集成发火(Auto-regressive Integrate-and-Fire, AIF)机制,动态决定何时发射翻译标记。还提出了一种可调延迟的AIF机制,既可在解码时控制质量-延迟权衡,也可在训练和解码阶段同时使用。LS-Transducer-SST能够通过其预测网络自然地利用仅包含文本的单语数据,有助于缓解端到端语音翻译数据稀缺的关键问题。在解码过程中,设计了基于块的增量联合解码技术,以细化和扩大搜索空间。在Fisher-CallHome西班牙语(西班牙-英语)和MuST-C英-德数据集上的实验表明,LS-Transducer-SST在质量-延迟权衡方面优于现有流行方法。例如,在类似延迟下,LS-Transducer-SST相较于CAAT在西班牙-英语/英-德上分别提升3.1/2.9个BLEU分数;在类似BLEU分数的条件下,相较于Wait-k,LS-Transducer-SST平均滞后延迟减少1.4秒。
引用
@article{arxiv.2406.04541,
title = {Label-Synchronous Neural Transducer for E2E Simultaneous Speech Translation},
author = {Keqi Deng and Philip C. Woodland},
journal= {arXiv preprint arXiv:2406.04541},
year = {2024}
}
备注
Accepted by ACL 2024 Main Conference