Text-controlled Motion Mamba: Text-Instructed Temporal Grounding of Human Motion
计算机视觉与模式识别
2025-10-21 v2 多媒体
摘要
人类运动理解是具有多样实际应用的基础任务,这得益于大规模运动捕捉数据集的可用性。最近的研究聚焦于文本-运动任务,如文本驱动的运动生成、编辑和问答。在本研究中,我们提出了一种新颖任务——基于文本的人类运动定位 (THMG),旨在精确定位给定文本描述在未裁剪运动序列中对应的时间段。捕获全局时序信息对于 THMG 任务至关重要。然而,依赖全局时序自注意力的 Transformer 模型在处理长未裁剪序列时面临计算成本呈二次增长的挑战。我们通过提出 Text-controlled Motion Mamba (TM-Mamba),一种集成时序全局上下文、语言查询控制和空间图拓扑的统一模型来解决这些挑战,仅需线性内存成本。该模型的核心是基于文本查询动态整合全局时序信息的文本控制选择机制。该模型通过集成关系嵌入进一步被增强为拓扑感知。为了进行评估,我们引入了 BABEL-Grounding,这是第一个提供人类动作详细文本描述及其对应时间段的文本-运动数据集。广泛的评估表明 TM-Mamba 在 BABEL-Grounding 上的有效性。
引用
@article{arxiv.2404.11375,
title = {Text-controlled Motion Mamba: Text-Instructed Temporal Grounding of Human Motion},
author = {Xinghan Wang and Zixi Kang and Yadong Mu},
journal= {arXiv preprint arXiv:2404.11375},
year = {2025}
}
备注
Accepted by IEEE Transactions on Image Processing (TIP)