MoChat: 基于关节分组的多回合运动理解的空间-时间 grounding LLM
计算机视觉与模式识别
2024-10-16 v1
摘要
尽管深度学习在人类运动理解方面持续取得进展,但现有模型通常难以准确识别动作时机和特定身体部位,通常只支持单轮交互。这种限制削弱了其在运动理解任务中捕捉细粒度运动细节的效果。本文提出了 MoChat,一种能够进行人类运动的空间-时间 grounding 和理解多轮对话上下文的多模态大语言模型。为实现这些能力,我们基于人类解剖结构将每个骨架帧的空间信息分组,然后将其与 Joints-Grouped Skeleton Encoder 结合,其输出与 LLM 嵌入一起创建空间感知和时间感知嵌入。此外,我们开发了一个从骨架序列中基于文本注释提取时间戳的管道,并构建用于空间 grounding 的多轮对话。最后,生成各种任务指令用于联合训练。实验结果表明,MoChat 在运动理解任务中在多个指标上实现了最先进的性能,成为能够对人类运动进行细粒度空间-时间 grounding 的第一个模型。
引用
@article{arxiv.2410.11404,
title = {MoChat: Joints-Grouped Spatio-Temporal Grounding LLM for Multi-Turn Motion Comprehension and Description},
author = {Jiawei Mo and Yixuan Chen and Rifen Lin and Yongkang Ni and Min Zeng and Xiping Hu and Min Li},
journal= {arXiv preprint arXiv:2410.11404},
year = {2024}
}