中文

评估点光生物运动在多模态大语言模型中的处理

计算机视觉与模式识别 2025-09-30 v1 人工智能

摘要

人类能够从最少的视觉线索中提取丰富的语义信息,这一能力由点光显示(PLDs)所证明,PLDs由局部于人体关键关节的稀疏点集合而成。这种能力在发展早期即出现,主要归因于人类的具身经验。由于PLDs仅将身体动作作为唯一的意义来源,因此成为测试这些系统在行动理解约束方面的关键刺激。本文引入ActPLD,首个用于评估MLLMs从人类PLD处理动作的基准测试。测试的模型包括针对单演员和社交互动PLDs的state-of-the-art专有和开源系统。我们的结果揭示了模型表现普遍较低,引入了行动和时空理解的根本性差距。

关键词

引用

@article{arxiv.2509.23517,
  title  = {Evaluating point-light biological motion in multimodal large language models},
  author = {Akila Kadambi and Marco Iacoboni and Lisa Aziz-Zadeh and Srini Narayanan},
  journal= {arXiv preprint arXiv:2509.23517},
  year   = {2025}
}