中文

MLLMs能否读懂氛围?多方社交互动欺骗评估的多模态基准

计算机视觉与模式识别 2025-11-21 v1 计算与语言

摘要

尽管多模态大语言模型(MLLMs)在推理能力方面表现突出,但它们显然缺乏人类智慧的核心组件:read the room的能力,以及对复杂社交互动中欺骗的判断。为严格量化这一失败,我们引入了新任务——多模态交互式欺骗评估(MIDA),并构建了一个新型多模态数据集,提供同步视频和文本,并为每一句话提供可验证的ground-truth标签。我们建立了全面的基准,评估了12个最先进的开源和闭源MLLMs,揭示了显著的性能差距:即便是像GPT-4o这样强大的模型,也难以可靠地区分真相与谎言。我们的失败模式分析表明,这些模型未能有效地将语言在多模态社交线索中进行 grounding,缺乏建模他人所知、所信、所意图的能力,凸显了构建更敏感且可信赖AI系统的紧迫需求。为迈出一步,我们设计了Social Chain-of-Thought(SoCoT)推理管道和Dynamic Social Epistemic Memory(DSEM)模块。我们的框架在这一具有挑战性的任务上实现了性能提升,为构建具备真正人类社交推理能力的MLLMs指明了有前景的道路。

关键词

引用

@article{arxiv.2511.16221,
  title  = {Can MLLMs Read the Room? A Multimodal Benchmark for Assessing Deception in Multi-Party Social Interactions},
  author = {Caixin Kang and Yifei Huang and Liangyang Ouyang and Mingfang Zhang and Ruicong Liu and Yoichi Sato},
  journal= {arXiv preprint arXiv:2511.16221},
  year   = {2025}
}