中文

改进视觉问答中的跨语言泛化能力

计算与语言 2022-12-01 v2

摘要

尽管多语言视觉-语言预训练模型已展现出若干优势,近期跨任务与跨语言的基准测试表明,当多语言预训练视觉-语言模型应用于非英语数据时,其跨语言泛化能力较差,且(有监督的)英语性能与(零样本的)跨语言迁移之间存在巨大差距。本工作中,我们探究了这些模型在零样本跨语言视觉问答(VQA)任务上的不佳表现,其中模型在英语视觉问答数据上微调,并在 7 种类型学上多样的语言上评估。我们通过三种策略改进跨语言迁移:(1)引入语言先验目标,以基于相似度的损失增强交叉熵损失,在训练期间引导模型;(2)学习特定于任务的子网络,在不修改模型的情况下改善跨语言泛化并降低方差;(3)使用合成代码混合增广训练样本,以促进源语言与目标语言间嵌入的对齐。我们在 xGQA 上使用预训练多语言多模态 Transformer UC2 与 M3P 的实验表明,所提出的微调策略对 7 种语言具有一致有效性,以稀疏模型优于现有迁移方法。复现我们发现的代码与数据已公开可用。

关键词

引用

@article{arxiv.2209.02982,
  title  = {Improving the Cross-Lingual Generalisation in Visual Question Answering},
  author = {Farhad Nooralahzadeh and Rico Sennrich},
  journal= {arXiv preprint arXiv:2209.02982},
  year   = {2022}
}

备注

This work is accepted by the AAAI 2023