通过语音到文本因果对齐的流式翻译与转录
计算与语言
2026-03-13 v1
摘要
同时机翻(SiMT)传统上依赖离线机器翻译模型,配合人工设计的启发式方法或学习到的策略。我们提出 Hikari,一种无策略、完全端到端的模型,通过将 READ/WRITE 决策编码为概率性 WAIT token 机制,实现语音到文本的同时翻译和流式转录。我们还引入了解码时间稀释(Decoder Time Dilation)机制,以减少自回归开销并确保训练分布的平衡。此外,我们提出了监督式微调策略,使模型能够从延迟中恢复,显著改善了质量-延迟权衡。我们在英语到日文、德语和俄语上进行评估,Hikari 在低延迟和高延迟 regime 中均取得了新的 SOTA BLEU 分数,超越了最近的基线模型。
引用
@article{arxiv.2603.11578,
title = {Streaming Translation and Transcription Through Speech-to-Text Causal Alignment},
author = {Roman Koshkin and Jeon Haesung and Lianbo Liu and Hao Shi and Mengjie Zhao and Yusuke Fujita and Yui Sudo},
journal= {arXiv preprint arXiv:2603.11578},
year = {2026}
}
备注
16 pages, 6 figures