中文

通过视觉问答对将探测信号引入多模态机器翻译

计算与语言 2023-10-27 v1 人工智能

摘要

本文对多模态机器翻译(MMT)进行了深入研究,考察了普遍观点——即当文本输入完整时 MMT 系统对视觉信息的敏感性下降。相反,我们将此现象归因于跨模态交互不足,而非图像信息冗余。提出一种新方法,从源文本生成并行的视觉问答(VQA)风格对,以促进更稳健的跨模态交互。利用大语言模型(LLMs),我们显式地对 MMT 中的探测信号建模,将其转换为 VQA 风格数据,从而创建 Multi30K-VQA 数据集。引入 MMT-VQA 多任务学习框架,将数据集中的显式探测信号纳入 MMT 训练过程。在两个广泛使用基准上的实验结果证明了该新方法的有效性。我们的代码与数据将发布于:\url{https://github.com/libeineu/MMT-VQA}。

关键词

引用

@article{arxiv.2310.17133,
  title  = {Incorporating Probing Signals into Multimodal Machine Translation via Visual Question-Answering Pairs},
  author = {Yuxin Zuo and Bei Li and Chuanhao Lv and Tong Zheng and Tong Xiao and Jingbo Zhu},
  journal= {arXiv preprint arXiv:2310.17133},
  year   = {2023}
}

备注

Findings of EMNLP2023