中文

感知还是偏见:多模态大语言模型能否超越人格的第一印象?

人工智能 2026-05-22 v1 计算机视觉与模式识别 计算机与社会

摘要

多模态大语言模型(MLLMs)日益被部署在需要人格感知的面向人类的角色中,但现有基准仅针对数值化的Big Five评分预测进行评估,留下了模型是否通过行为理解来感知人格或仅通过浅层模式匹配来预判的悬疑。我们通过三个贡献来弥补这一空白。(i)提出新任务:我们形式化了Grounded Personality Reasoning(GPR),该任务要求MLLMs在可观察证据基础上通过评分、推理和锚定三个环节为每个Big Five评分提供依据。(ii)构建新数据集:我们发布了MM-OCEAN(1,104个视频,5,320个 MCQs),由多智能体管道生成并经人类验证,包含带时间戳的行为观察、证据锚定的特征分析以及七类线索锚定MCQ。(iii)基准测试与分析:我们设计了三级评估(评分、推理、锚定)外加四个样本级失效模式指标:偏见率(PR)、幻觉率(CR)、集成失效率(IR)和整体锚定率(HR),并对27个MLLMs(13个封闭式,14个开放式)进行基准测试。分析揭示了惊人的偏见差距:在该领域,51%的正确评分未锚定在检索到的线索中,整体锚定率仅为0-33.5%。这些发现暴露了在正确得分与为正确的原因进行推理之间存在的断层,为MLLMs的基于证据的社交认知绘画了路线图。

关键词

引用

@article{arxiv.2605.22109,
  title  = {Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?},
  author = {Caixin Kang and Tianyu Yan and Sitong Gong and Mingfang Zhang and Liangyang Ouyang and Ruicong Liu and Bo Zheng and Huchuan Lu and Kaipeng Zhang and Yoichi Sato and Yifei Huang},
  journal= {arXiv preprint arXiv:2605.22109},
  year   = {2026}
}