中文

Value-Spectrum:基于社交媒体语境中的价值分解量化视觉语言模型的偏好

计算与语言 2025-06-04 v3

摘要

视觉语言模型(VLM)的最新进展拓宽了多模态应用的范畴。然而,评估通常局限于功能性任务,忽视了人格特质和人类价值观等抽象维度。为填补这一空白,我们引入了 Value-Spectrum,一种新颖的视觉问答(VQA)基准,旨在基于 Schwartz 的价值维度评估 VLM,该维度捕捉了指导人们偏好与行动的核心人类价值观。我们设计了 VLM 智能体流水线来模拟视频浏览,并构建了一个包含来自 TikTok、YouTube Shorts 和 Instagram Reels 的超过 50,000 个短视频的向量数据库。这些视频跨越数月,涵盖家庭、健康、爱好、社会、科技等多种主题。在 Value-Spectrum 上的基准测试突显了 VLM 在处理价值导向内容时的显著差异。除了识别 VLM 的内在偏好外,我们还探索了 VLM 智能体在显式提示下扮演特定角色的能力,揭示了模型在角色扮演场景中的适应性。这些发现突显了 Value-Spectrum 作为综合评估集的潜力,可用于追踪 VLM 在基于价值的任务中的偏好及其模拟多样角色的能力。完整代码和数据可在以下网址获取:https://github.com/Jeremyyny/Value-Spectrum。

关键词

引用

@article{arxiv.2411.11479,
  title  = {Value-Spectrum: Quantifying Preferences of Vision-Language Models via Value Decomposition in Social Media Contexts},
  author = {Jingxuan Li and Yuning Yang and Shengqi Yang and Linfan Zhang and Ying Nian Wu},
  journal= {arXiv preprint arXiv:2411.11479},
  year   = {2025}
}

备注

ACL 2025 main