MLLMs 能否「读懂」现场?多方社交互动真实性验证的多模态基准
计算机视觉与模式识别
2025-11-05 v2 计算与语言
社会与信息网络
摘要
随着 AI 系统在人类生活中的深度融合,赋予其稳健的社交智能已成为关键前沿。这种智能的一个关键方面是辨别真相与欺骗,这是人类交互中普遍存在的元素,由复杂的语言与非语言视觉线索共同表达。然而,在动态的多方对话中实现自动欺骗检测仍是重大挑战。近期强大的多模态大语言模型(MLLM)凭借其在视觉与文本理解方面的卓越能力,成为该任务的自然候选人。因此,这些模型在这一关键领域的能力大多尚未被量化。为填补这一空白,我们提出了全新的任务——多模态交互式真实性评估(MIVA),并构建了一个新型多模态数据集,源自社交推理游戏「狼人杀」。该数据集提供同步的视频、文本数据,并为每一陈述提供可验证的真实性标签。我们建立了全面的基准,评估了最先进的 MLLM,结果显示出显著的性能差距:即便是像 GPT-4o 这类强大模型,也难以可靠地区分真相与谎言。我们的失败模式分析表明,这些模型未能有效地将语言锚定在视觉社交线索上,可能过于保守地对齐,从凸显构建更敏感且可信赖的 AI 系统的迫切需求。
引用
@article{arxiv.2510.27195,
title = {Can MLLMs Read the Room? A Multimodal Benchmark for Verifying Truthfulness in Multi-Party Social Interactions},
author = {Caixin Kang and Yifei Huang and Liangyang Ouyang and Mingfang Zhang and Yoichi Sato},
journal= {arXiv preprint arXiv:2510.27195},
year = {2025}
}
备注
ICCV2025 Workshop