中文

众擎之力:用于文化图像描述的多智能体多模态模型

计算机视觉与模式识别 2024-11-19 v1 人工智能 计算与语言

摘要

大型多模态模型(Large Multimodal Models, LMMs)在各种多模态任务中展现出令人瞩目的性能。然而,由于大多数数据和模型以西方文化为中心,它们在跨文化语境下的有效性仍然有限。相反,多智能体模型在解决复杂任务方面已展现出显著能力。我们的研究评估了 LMMs 在多智能体交互设置下的集体性能,以应对文化图像描述这一新颖任务。我们的贡献如下:(1)我们引入了 MosAIC,这是一个多智能体框架,旨在利用具有不同文化身份的 LMMs 来增强跨文化图像描述;(2)我们提供了一个针对来自中国、印度和罗马尼亚的图像的英语文化丰富型图像描述数据集,涵盖三个数据集:GeoDE、GD-VCR、CVQA;(3)我们提出了一种可适配文化的指标,用于评估图像描述中的文化信息;(4)我们表明多智能体交互在不同指标上优于单智能体模型,并为未来研究提供了有价值的见解。我们的数据集和模型可在 https://github.com/MichiganNLP/MosAIC 获取。

关键词

引用

@article{arxiv.2411.11758,
  title  = {The Power of Many: Multi-Agent Multimodal Models for Cultural Image Captioning},
  author = {Longju Bai and Angana Borah and Oana Ignat and Rada Mihalcea},
  journal= {arXiv preprint arXiv:2411.11758},
  year   = {2024}
}