中文

千言或图:研究人格模态在多模态LLM中的影响

计算与语言 2025-03-03 v1 人工智能 计算机视觉与模式识别

摘要

大型语言模型(LLMs)最近在体现多样化人格方面取得了显著进展,增强了其作为对话代理和虚拟助理的效果。因此,LLMs在处理和整合多模态信息方面取得了重要进展。然而,尽管人类人格可以以文本和图像两种方式表达,但人格模态对LLM体现程度的影响范围仍然鲁莽未探索。本文调查了不同模态如何影响多模态LLM中人格的表达度。为此,我们创建了一个包含40个多样化人格(varying in age, gender, occupation, and location)的模态平行数据集,这包括四种等效表示人格的模态:图像-only、文本-only、图像和小文本的组合,以及带有视觉修饰文本的图像,其中文本被视觉地修饰以传递与人格相关的属性。我们随后创建一个系统化的评估框架,包含60个问题和相应的指标,以评估LLMs在其属性和情景中如何很好地体现每个人格。对5个多模态LLMs进行全面实验表明,由详细文本表示的人格显示出更多语言习惯,而带有视觉修饰文本的图像常常更符合人格。我们的结果表明,LLMs常常忽略通过图像传递的细节,凸显了其内在局限性,并为未来研究提供了通往桥接这一鸿沟的道路。我们在https://github.com/claws-lab/persona-modality发布数据和代码。

关键词

引用

@article{arxiv.2502.20504,
  title  = {A Thousand Words or An Image: Studying the Influence of Persona Modality in Multimodal LLMs},
  author = {Julius Broomfield and Kartik Sharma and Srijan Kumar},
  journal= {arXiv preprint arXiv:2502.20504},
  year   = {2025}
}