中文

MimeQA:面向社交智能非语言基础模型

计算与语言 2025-12-02 v3 人工智能 计算机视觉与模式识别

摘要

随着 AI 与人们日常活动的越来越紧密结合,能够理解并无缝与人类在日常生活中互动的社交智能 AI 正变得越来越重要。然而,当前在 AI 社交推理中的工作都依赖于仅语言或以语言为主的方法进行基准测试和模型训练,导致这些系统在语言交流方面取得进步,但在非语言社交理解方面存在困难。为克服这一局限,我们利用富含非语言社交互动的新型数据源——隐秘视频。隐秋指通过手势和动作表达而不发声,这在解释非语言社交交流方面 presents 独特的挑战和机遇。我们贡献了一个新数据集称为 MimeQA,通过从 YouTube 获取约 8 小时的视频片段,并开发了一个全面的视频问答基准,包含 806 个经过仔细标注和验证的问答对,旨在探测非语言社交推理能力。使用 MimeQA,我们评估了最先进的视频大型语言模型(VideoLLMs),发现它们的准确率很低,通常在 20% 到 30% 之间,而人类得分高达 86%。我们的分析表明,VideoLLMs 常常无法将想象物体对齐,过度依赖文本提示而忽略了非语言交互的细微之处。我们希望激励未来的工作,开发具备真正社交智能的 AI 模型,能够解释非语言的人类交互。

关键词

引用

@article{arxiv.2502.16671,
  title  = {MimeQA: Towards Socially-Intelligent Nonverbal Foundation Models},
  author = {Hengzhi Li and Megan Tjandrasuwita and Yi R. Fung and Armando Solar-Lezama and Paul Pu Liang},
  journal= {arXiv preprint arXiv:2502.16671},
  year   = {2025}
}

备注

NeurIPS 2025 Datasets and Benchmarks