重新定义机器同声传译:从增量翻译到类人策略
计算与语言
2026-01-19 v1
摘要
同声机器翻译 (SiMT) 要求在严格的实时约束下提供高质量翻译,而仅具有 READ/WRITE 动作的传统策略无法完全应对。我们通过四种自适应动作扩展了 SiMT 的动作空间:Sentence_Cut、Drop、Partial_Summarization 和 Pronominalization,这些动作能够在保持语义保真度的同时实现实时重构、省略和简化。我们在大语言模型 (LLM) 框架中适配这些动作,并通过动作感知提示构建训练参考。为了评估翻译质量和词级单调性,我们进一步开发了一个延迟感知的 TTS 流水线,将文本输出映射为具有真实时序的语音。在 ACL60/60 英中、英德和英日基准上的实验表明,与参考翻译和基于分段策略的基线相比,我们的框架持续提升了语义指标并实现了更低的延迟。值得注意的是,结合 Drop 和 Sentence_Cut 在流畅性与延迟的平衡上带来了持续的改进。这些结果表明,丰富基于 LLM 的 SiMT 的动作空间为弥合人类与机器口译之间的差距提供了一个有前景的方向。
引用
@article{arxiv.2601.11002,
title = {Redefining Machine Simultaneous Interpretation: From Incremental Translation to Human-Like Strategies},
author = {Qianen Zhang and Zeyu Yang and Satoshi Nakamura},
journal= {arXiv preprint arXiv:2601.11002},
year = {2026}
}
备注
arXiv admin note: substantial text overlap with arXiv:2509.21801