多语言视觉推理中缺失了什么以及如何修复
计算与语言
2025-02-11 v2
摘要
当今的 NLP 模型致力于支持多种语言和模态,以提高不同用户的可访问性。在本文中,我们通过测试视觉推理任务来评估它们的多语言、多模态能力。我们观察到,诸如 GPT-4V 等专有系统目前在该任务上取得了最佳性能,但开源模型相比之下仍有差距。令人惊讶的是,GPT-4V 在英语和其他语言之间表现出相似的性能,表明跨语言公平系统开发的潜力。我们对模型失败的分析揭示了使该任务具有挑战性的三个关键方面:多语言性、复杂推理和多模态性。为了应对这些挑战,我们提出了三种针对性的干预措施,包括解决多语言性的翻译-测试方法、分解复杂推理的视觉编程方法,以及利用图像描述解决多模态性的方法。我们的干预措施在零样本设置下实现了该任务上最佳的开源性能,将开源模型 LLaVA-v1.5-13B、LLaVA-v1.6-34B 和 Qwen-VL 分别提升了 13.4%、20.3% 和 16.7%,同时也小幅提升了 GPT-4V 的性能。
引用
@article{arxiv.2403.01404,
title = {What Is Missing in Multilingual Visual Reasoning and How to Fix It},
author = {Yueqi Song and Simran Khanuja and Graham Neubig},
journal= {arXiv preprint arXiv:2403.01404},
year = {2025}
}