面向直播字幕的同步语音翻译:从延迟到显示
计算与语言
2023-10-19 v2
摘要
随着交流中视听化的增强,多语言活动对直播字幕的需求比以往更为突出。为尝试实现该流程的自动化,我们旨在探索同步语音翻译(SimulST)用于直播字幕的可行性。然而,SimulST 系统逐词生成的速率并不利于以易懂且可读的方式显示字幕。在本工作中,我们调整 SimulST 系统以在生成翻译的同时预测字幕断点。随后我们提出一种显示模式,利用预测的断点结构以滚动行的方式呈现字幕。我们在阅读速度与延迟方面,将所提模式与 1) 逐词和 2) 分块显示模式进行比较。在三个语言对(en→it、de、fr)上的实验表明,滚动行是唯一能在保持延迟接近 4 秒阈值的同时达到可接受阅读速度的模式。我们认为,用于可读直播字幕的同步翻译仍面临挑战,其主要挑战在于翻译质量较差,并提出了指引未来研究的方向。
引用
@article{arxiv.2107.08807,
title = {Simultaneous Speech Translation for Live Subtitling: from Delay to Display},
author = {Alina Karakanta and Sara Papi and Matteo Negri and Marco Turchi},
journal= {arXiv preprint arXiv:2107.08807},
year = {2023}
}