TopicVD:用于纪录片的主题驱动视频多模态机器翻译数据集
计算与语言
2025-05-12 v1
摘要
现有大多数多模态机器翻译(MMT)数据集主要由静态图像或短视频片段组成,缺乏跨 diverse 领域和主题的大量视频数据,因此难以满足现实世界 MMT 任务的需求,如纪录片翻译。本研究开发了 TopicVD,这是一个用于纪录片视频支持多模态机器翻译的主题驱动数据集,旨在推动该领域的研究。我们收集了来自纪录片的视频字幕对,并将其分为八个主题(如经济、自然),以促进视频导向 MMT 中领域适应的研究。此外,我们保留了其上下文信息,以支持研究如何在视频导向 MMT 中利用纪录片的全局上下文。为更好地捕捉文本与视频之间的共享语义,我们提出了一种基于跨模态双向注意力模块的 MMT 模型。在 TopicVD 数据集上进行的大量实验表明,视觉信息持续改善了纪录片翻译中 NMT 模型的性能。然而,MMT 模型在跨域场景中的性能显著下降,凸显了需要有效领域适应方法的重要性。此外,实验表明,全局上下文能够有效提升翻译性能。% 数据集及我们的方法实现已在 https://github.com/JinzeLv/TopicVD 上提供。
引用
@article{arxiv.2505.05714,
title = {TopicVD: A Topic-Based Dataset of Video-Guided Multimodal Machine Translation for Documentaries},
author = {Jinze Lv and Jian Chen and Zi Long and Xianghua Fu and Yin Chen},
journal= {arXiv preprint arXiv:2505.05714},
year = {2025}
}
备注
NLDB 2025