BOOM:超越单一模态——KIT多模态多语言讲座伴侣
计算与语言
2026-02-24 v2
摘要
教育的全球化和在线学习的快速增长使教育内容的本地化成为一项关键挑战。讲座材料本质上是多模态的,结合了口语音频与视觉幻灯片,这需要能够处理多种输入模态的系统。为了提供可访问且完整的学习体验,翻译必须保留所有模态:用于阅读的文本、用于视觉理解的幻灯片以及用于听觉学习的语音。我们提出\textbf{BOOM},一种多模态多语言讲座伴侣,能够联合翻译讲座音频和幻灯片,生成三种模态的同步输出:翻译文本、保留视觉元素的本地化幻灯片以及合成语音。这种端到端方法使学生能够以母语访问讲座,同时旨在完整保留原始内容。我们的实验表明,幻灯片感知转录对下游任务(如摘要和问答)也产生了级联益处。演示视频和代码可在 https://ai4lt.github.io/boom/ 获取\footnote{所有发布的代码和模型均根据MIT许可证授权}。
引用
@article{arxiv.2512.02817,
title = {BOOM: Beyond Only One Modality KIT's Multimodal Multilingual Lecture Companion},
author = {Sai Koneru and Fabian Retkowski and Christian Huber and Lukas Hilgert and Seymanur Akti and Enes Yavuz Ugan and Alexander Waibel and Jan Niehues},
journal= {arXiv preprint arXiv:2512.02817},
year = {2026}
}
备注
Under review