视频有助的多模态机器翻译
计算与语言
2023-11-01 v1
摘要
现有的多模态机器翻译(MMT)数据集由图像与视频字幕或教学视频字幕组成,其中很少包含语言歧义,使得视觉信息在生成恰当翻译时无效。近期工作构建了歧义字幕数据集以缓解此问题,但仍受限于视频未必有助于消歧。我们引入EVA(用于歧义字幕翻译的大规模训练集与视频有助评估集),一个包含852k日英(Ja-En)平行字幕对、520k中英(Zh-En)平行字幕对以及从电影和剧集中收集对应视频片段的MMT数据集。除大规模训练集外,EVA包含一个视频有助评估集,其中字幕存在歧义且视频保证有助于消歧。此外,我们提出SAFA,一种基于选择性注意力模型的MMT模型,带两种新方法:帧注意力损失与歧义增强,旨在充分利用EVA中的视频进行消歧。在EVA上的实验表明视觉信息与所提方法能提升翻译性能,且我们的模型显著优于现有MMT模型。EVA数据集与SAFA模型可在:https://github.com/ku-nlp/video-helpful-MMT.git 获取。
引用
@article{arxiv.2310.20201,
title = {Video-Helpful Multimodal Machine Translation},
author = {Yihang Li and Shuichiro Shimizu and Chenhui Chu and Sadao Kurohashi and Wei Li},
journal= {arXiv preprint arXiv:2310.20201},
year = {2023}
}
备注
Accepted by EMNLP 2023 Main Conference (long paper)