中文

视觉语言模型作为价值探测器

人机交互 2025-01-08 v1 计算机视觉与模式识别

摘要

将文本和视觉输入集成的大型语言模型引入了一种新的可能性,用于解释复杂数据。尽管这些模型在基于视觉刺激生成连贯且上下文相关的文本方面表现卓越,但在识别图像中相关元素的人类感知对齐方面仍需进一步探索。本文研究了最先进的LLMs与人类标注员在识别家庭环境情景中相关元素的对齐情况。我们创建了一组十二个描绘各种家庭情景的图像,并邀请了十四名标注员为每张图像识别关键元素。随后,我们将这些人类响应与来自五个不同LLMs的输出进行比较,包括GPT-4o和四个LLaVA变体。我们的发现显示,对齐程度各不相同,其中LLaVA 34B表现最佳,但仍得分较低。然而,对结果的分析表明,这些模型有望检测图像中的价值相关元素,表明在改进训练和优化提示后,LLMs有望通过提供更深入的见解和更具上下文相关性的响应,增强应用于社交机器人、辅助技术和人机交互等领域的应用。

关键词

引用

@article{arxiv.2501.03957,
  title  = {Vision Language Models as Values Detectors},
  author = {Giulio Antonio Abbo and Tony Belpaeme},
  journal= {arXiv preprint arXiv:2501.03957},
  year   = {2025}
}

备注

13 pages, 2 figures