中文

探索多模态大语言模型在分配视觉人格下的行为变化

计算与语言 2024-10-07 v1

摘要

本研究是首次探讨多模态大语言模型 (LLMs) 是否能够与视觉人格对齐其行为,旨在填补文献中显著空白,该空白主要聚焦于基于文本的人格。我们开发了一个包含 5000 个虚构头像图像的新型数据集,用于分配给 LLMs 作为视觉人格,并分析其根据这些图像所呈现的视觉特征进行的谈判行为,特别关注攻击性。结果表明,LLMs 对图像攻击性的评估方式类似于人类,当提示搭配攻击性视觉人格时,输出更具攻击性的谈判行为。有趣的是,LLM 在对手图像看起来不如自己攻击性时表现出更具攻击性的谈判行为,而在对手图像看起来更具攻击性时则表现出较少的攻击性行为。

关键词

引用

@article{arxiv.2410.03181,
  title  = {Kiss up, Kick down: Exploring Behavioral Changes in Multi-modal Large Language Models with Assigned Visual Personas},
  author = {Seungjong Sun and Eungu Lee and Seo Yeon Baek and Seunghyun Hwang and Wonbyung Lee and Dongyan Nan and Bernard J. Jansen and Jang Hyun Kim},
  journal= {arXiv preprint arXiv:2410.03181},
  year   = {2024}
}

备注

EMNLP 2024