中文

MLLMs 能否「读懂」现场?多方社交互动真实性验证的多模态基准

计算机视觉与模式识别 2025-11-05 v2 计算与语言 社会与信息网络

摘要

随着 AI 系统在人类生活中的深度融合,赋予其稳健的社交智能已成为关键前沿。这种智能的一个关键方面是辨别真相与欺骗,这是人类交互中普遍存在的元素,由复杂的语言与非语言视觉线索共同表达。然而,在动态的多方对话中实现自动欺骗检测仍是重大挑战。近期强大的多模态大语言模型(MLLM)凭借其在视觉与文本理解方面的卓越能力,成为该任务的自然候选人。因此,这些模型在这一关键领域的能力大多尚未被量化。为填补这一空白,我们提出了全新的任务——多模态交互式真实性评估(MIVA),并构建了一个新型多模态数据集,源自社交推理游戏「狼人杀」。该数据集提供同步的视频、文本数据,并为每一陈述提供可验证的真实性标签。我们建立了全面的基准,评估了最先进的 MLLM,结果显示出显著的性能差距:即便是像 GPT-4o 这类强大模型,也难以可靠地区分真相与谎言。我们的失败模式分析表明,这些模型未能有效地将语言锚定在视觉社交线索上,可能过于保守地对齐,从凸显构建更敏感且可信赖的 AI 系统的迫切需求。

关键词

引用

@article{arxiv.2510.27195,
  title  = {Can MLLMs Read the Room? A Multimodal Benchmark for Verifying Truthfulness in Multi-Party Social Interactions},
  author = {Caixin Kang and Yifei Huang and Liangyang Ouyang and Mingfang Zhang and Yoichi Sato},
  journal= {arXiv preprint arXiv:2510.27195},
  year   = {2025}
}

备注

ICCV2025 Workshop