中文

大型语言模型能否理解视觉内容中的概念?以关于抑郁症的YouTube短视频为例的案例研究

人机交互 2025-03-10 v1 计算机与社会

摘要

大型语言模型(LLM)越来越多地被用于辅助计算社会科学研究。虽然先前的工作主要集中在文本上,但利用多模态大语言模型(MLLM)进行在线视频研究的潜力仍未得到充分探索。我们开展了首批关于MLLM辅助视频内容分析的案例研究之一,将人工智能的解释与人类对抽象概念的理解进行比较。我们利用LLaVA-1.6 Mistral 7B来解释关于视频中介自我表露的四个抽象概念,分析了来自142个与抑郁症相关的YouTube短视频中的725个关键帧。我们对MLLM自我生成的解释进行了定性分析,发现操作化程度会影响MLLM的解释。有趣的是,更详细的描述并不一定会提高人机对齐度。我们还确定了影响AI与人类理解对齐的其他因素,例如概念的复杂性和视频类型的多样性。我们的探索性研究强调需要针对特定概念定制提示词,并呼吁研究人员在与AI系统进行多模态环境下的合作时,纳入更多以人为中心的评估。

关键词

引用

@article{arxiv.2503.05109,
  title  = {Can Large Language Models Grasp Concepts in Visual Content? A Case Study on YouTube Shorts about Depression},
  author = {Jiaying "Lizzy" Liu and Yiheng Su and Praneel Seth},
  journal= {arXiv preprint arXiv:2503.05109},
  year   = {2025}
}

备注

11 pages