多模态机器翻译中的视觉特征研究
计算与语言
2022-03-18 v1
摘要
先前关于多模态机器翻译(MMT)的研究多聚焦于将视觉特征融入翻译的方法,却很少关注视觉模型的质量。本文中,我们探究视觉模型对 MMT 的影响。鉴于 Transformer 在计算机视觉中日益流行,我们使用多种强模型(如 Vision Transformer)和增强特征(如目标检测与图像描述)进行实验。我们设计了一个选择性注意力模型,以研究图像在 MMT 中的块级贡献。在详细的探测任务中,我们发现更强的视觉模型有助于从视觉模态学习翻译。我们的结果也表明需要仔细审视 MMT 模型,尤其是在当前基准小规模且有偏的情况下。我们的代码见 \url{https://github.com/libeineu/fairseq_mmt}。
引用
@article{arxiv.2203.09173,
title = {On Vision Features in Multimodal Machine Translation},
author = {Bei Li and Chuanhao Lv and Zefan Zhou and Tao Zhou and Tong Xiao and Anxiang Ma and JingBo Zhu},
journal= {arXiv preprint arXiv:2203.09173},
year = {2022}
}
备注
Long paper accepted by ACL2022 main conference