中文

多语言视觉推理中缺失了什么以及如何修复

计算与语言 2025-02-11 v2

摘要

当今的 NLP 模型致力于支持多种语言和模态,以提高不同用户的可访问性。在本文中,我们通过测试视觉推理任务来评估它们的多语言、多模态能力。我们观察到,诸如 GPT-4V 等专有系统目前在该任务上取得了最佳性能,但开源模型相比之下仍有差距。令人惊讶的是,GPT-4V 在英语和其他语言之间表现出相似的性能,表明跨语言公平系统开发的潜力。我们对模型失败的分析揭示了使该任务具有挑战性的三个关键方面:多语言性、复杂推理和多模态性。为了应对这些挑战,我们提出了三种针对性的干预措施,包括解决多语言性的翻译-测试方法、分解复杂推理的视觉编程方法,以及利用图像描述解决多模态性的方法。我们的干预措施在零样本设置下实现了该任务上最佳的开源性能,将开源模型 LLaVA-v1.5-13B、LLaVA-v1.6-34B 和 Qwen-VL 分别提升了 13.4%、20.3% 和 16.7%,同时也小幅提升了 GPT-4V 的性能。

关键词

引用

@article{arxiv.2403.01404,
  title  = {What Is Missing in Multilingual Visual Reasoning and How to Fix It},
  author = {Yueqi Song and Simran Khanuja and Graham Neubig},
  journal= {arXiv preprint arXiv:2403.01404},
  year   = {2025}
}