中文

视觉语言模型行为偏差:一种行为金融学视角

计算与语言 2024-09-24 v1 人工智能

摘要

大型视觉语言模型(LVLMs)正在快速发展,因为大语言模型(LLMs)被赋予了视觉模块以创建更贴近人类的模型。然而,我们应谨慎评估其在不同领域的应用,因为它们可能具有不希望的偏见。我们的工作从行为金融学的角度研究LVLMs的潜在行为偏差,这是一种结合金融与心理学的跨学科学科。我们提出了一个从数据收集到新评估指标的端到端框架,用于评估LVLMs的推理能力以及在两种既定人类金融行为偏差中表现出的动态行为:近期偏差和权威偏差。我们的评估发现,近期开源LVLMs如LLaVA-NeXT、MobileVLM-V2、Mini-Gemini、MiniCPM-Llama3-V 2.5和Phi-3-vision-128k在这两种偏差方面受到严重影响,而专有模型GPT-4o几乎不受影响。我们的观察指向开源模型可以改进的方向。代码已公开于https://github.com/mydcxiao/vlm_behavioral_fin。

关键词

引用

@article{arxiv.2409.15256,
  title  = {Behavioral Bias of Vision-Language Models: A Behavioral Finance View},
  author = {Yuhang Xiao and Yudi Lin and Ming-Chang Chiu},
  journal= {arXiv preprint arXiv:2409.15256},
  year   = {2024}
}

备注

ICML 2024 Workshop on Large Language Models and Cognition