MotionLLM:从人类动作和视频中理解人类行为
计算机视觉与模式识别
2024-05-31 v1
摘要
本研究聚焦于多模态(即视频和动作模态)人类行为理解领域,利用大语言模型(LLM)的强大能力。与最近设计用于视频单一或动作单一理解的LLM不同,我们认为,正确地理解人类行为需要同时从视频和动作序列(例如SMPL序列)进行联合建模,以有效捕捉细微的身体部位动态和语义。基于此,我们提出MotionLLM,一个简洁而有效的人类动作理解、描述和推理框架。具体而言,MotionLLM采用统一的视频-动作训练策略,利用现有粗糙视频-文本数据和细粒度动作-文本数据的互补优势,获取丰富的时空洞察。此外,我们收集了一个大型数据集MoVid,包含多样化的视频、动作、描述和指令。我们还提出了MoVid-Bench,经过严格的人工注释,以更好地评估视频和动作上的人类行为理解。大量实验表明,MotionLLM在描述、时空理解和推理能力方面均显著优于其他方法。
引用
@article{arxiv.2405.20340,
title = {MotionLLM: Understanding Human Behaviors from Human Motions and Videos},
author = {Ling-Hao Chen and Shunlin Lu and Ailing Zeng and Hao Zhang and Benyou Wang and Ruimao Zhang and Lei Zhang},
journal= {arXiv preprint arXiv:2405.20340},
year = {2024}
}
备注
MotionLLM version 1.0, project page see https://lhchen.top/MotionLLM