中文

VIVA:面向人类价值驱动的视觉决策基准

计算与语言 2024-10-11 v2 计算机视觉与模式识别

摘要

大型视觉语言模型 (VLM) 已显示出巨大的潜力,可集成到日常生活中,因此对于它们在现实情境中做出决策至关重要的是必须纳入人类价值观。本文介绍 VIVA,一个以人类价值驱动的视觉决策基准。虽然大多数大型 VLM 专注于物理层面的技能,但我们的工作是首次检查它们在利用人类价值做出受视觉描述制约的决策方面的多模态能力。VIVA 包含 1240 幅描绘多样化现实情境的图像,并对其上的决策进行了手动标注。给定一幅图像,模型应选择最恰当的动作来解决该情境,并提供相关的人类价值及其背后的原因。基于 VIVA 的大量实验显示,VLM 在利用人类价值做出多模态决策方面的局限性。进一步的分析表明,利用动作后果和预测的人类价值潜在带来诸多好处。

关键词

引用

@article{arxiv.2407.03000,
  title  = {VIVA: A Benchmark for Vision-Grounded Decision-Making with Human Values},
  author = {Zhe Hu and Yixiao Ren and Jing Li and Yu Yin},
  journal= {arXiv preprint arXiv:2407.03000},
  year   = {2024}
}

备注

EMNLP 2024 Main Conference