中文

IRR:用于评估视觉 - 语言模型的图像评论排序框架

计算与语言 2024-12-17 v2 人工智能 计算机视觉与模式识别 多媒体

摘要

大规模视觉 - 语言模型(LVLMs)同时处理图像和文本,在图像字幕生成和描述生成等多模态任务中表现出色。然而,虽然这些模型擅长生成事实性内容,但它们根据上下文生成和评估反映对同一图像不同观点的文本的能力尚未得到充分探索。为此,我们提出了 IRR:图像评论排序(Image Review Rank),这是一个旨在从多个角度评估评论文本的新型评估框架。IRR 通过衡量 LVLMs 的判断与人类解释的接近程度来评估它们。我们使用一个包含 15 个类别图像的数据集对其进行验证,每个类别包含五条评论文本以及英语和日语的注释排序,总计超过 2,000 个数据实例。数据集可在 https://hf.co/datasets/naist-nlp/Wiki-ImageReview1.0 获取。我们的结果表明,尽管 LVLMs 在不同语言间表现出一致的性能,但它们与人类注释的相关性不足,突显了进一步进步的必要性。这些发现强调了当前评估方法的局限性,以及在视觉与语言任务中需要更好地捕捉人类推理的方法。

关键词

引用

@article{arxiv.2402.12121,
  title  = {IRR: Image Review Ranking Framework for Evaluating Vision-Language Models},
  author = {Kazuki Hayashi and Kazuma Onishi and Toma Suzuki and Yusuke Ide and Seiji Gobara and Shigeki Saito and Yusuke Sakai and Hidetaka Kamigaito and Katsuhiko Hayashi and Taro Watanabe},
  journal= {arXiv preprint arXiv:2402.12121},
  year   = {2024}
}

备注

18pages, Accepted at COLING25