中文

EgoToM:从第三人称视角视频中推理心智模型的基准

计算机视觉与模式识别 2025-03-31 v1 人工智能

摘要

我们提出EgoToM,一个新的视频问答基准,旨在将心智理论(Theory-of-Mind, ToM)评估扩展至第三人称视角领域。我们运用因果心智模型方法,为Ego4D数据集生成多选择式视频问答实例,以评估预测摄像者目标、信念与下一行动的能力。我们研究了人类与先进多模态大语言模型(Multimodal Large Language Models, MLLMs)在这三个相互关联推理问题上的表现。我们的评估显示,MLLMs在从第三人称视角视频中推断目标方面达到了接近人类水平的准确率。然而,包括我们测试的规模最大的MLLMs(参数超过1000亿)在推断摄像者当下信念状态以及与未见视频未来最一致的行动时,仍不及人类表现。我们认为,这些结果将塑造未来设计一种重要类电子助手的方向,这类助手配备了对用户内部心理状态具有合理模型的能力。

关键词

引用

@article{arxiv.2503.22152,
  title  = {EgoToM: Benchmarking Theory of Mind Reasoning from Egocentric Videos},
  author = {Yuxuan Li and Vijay Veerabadran and Michael L. Iuzzolino and Brett D. Roads and Asli Celikyilmaz and Karl Ridgeway},
  journal= {arXiv preprint arXiv:2503.22152},
  year   = {2025}
}