评估点光生物运动在多模态大语言模型中的处理
计算机视觉与模式识别
2025-09-30 v1 人工智能
摘要
人类能够从最少的视觉线索中提取丰富的语义信息,这一能力由点光显示(PLDs)所证明,PLDs由局部于人体关键关节的稀疏点集合而成。这种能力在发展早期即出现,主要归因于人类的具身经验。由于PLDs仅将身体动作作为唯一的意义来源,因此成为测试这些系统在行动理解约束方面的关键刺激。本文引入ActPLD,首个用于评估MLLMs从人类PLD处理动作的基准测试。测试的模型包括针对单演员和社交互动PLDs的state-of-the-art专有和开源系统。我们的结果揭示了模型表现普遍较低,引入了行动和时空理解的根本性差距。
关键词
引用
@article{arxiv.2509.23517,
title = {Evaluating point-light biological motion in multimodal large language models},
author = {Akila Kadambi and Marco Iacoboni and Lisa Aziz-Zadeh and Srini Narayanan},
journal= {arXiv preprint arXiv:2509.23517},
year = {2025}
}