中文

基于测试时训练的零样态开放词汇人体姿态 grounding

计算机视觉与模式识别 2025-11-20 v1

摘要

理解复杂人类活动需要将运动分解为细粒度、语义对齐的子动作。这种姿态 grounding 对行为分析、具身 AI 和虚拟现实至关重要。然而,大多数现有方法依赖于预定义动作类的密集监督,这在开放词汇、真实世界场景中不可行。本文提出 ZOMG(Zero-shot Open-Vocabulary Motion Grounding),一个零样态、开放词汇框架,可在不要求任何标注或微调的情况下,将运动序列分割为语义上有意义的子动作。技术上,ZOMG 集成了 (1) 语言语义分区,该方法利用大型语言模型将指令分解为有序的子动作单元,以及 (2) 软掩码优化,该方法学习与子动作相关的时序掩码,以聚焦于关键帧,同时保持段内连续性并强制段间分离,全部而不改变预训练编码器。实验在三个运动-语言数据集上表明,ZOMG 在姿态 grounding 性能上实现了最新的有效性和效率, 在 HumanML3D 基准上超过前任方法 +8.7% mAP。与此同时,下游检索方面也取得了显著改进,建立了一种无标注运动理解的新范式。

关键词

引用

@article{arxiv.2511.15379,
  title  = {Zero-Shot Open-Vocabulary Human Motion Grounding with Test-Time Training},
  author = {Yunjiao Zhou and Xinyan Chen and Junlang Qian and Lihua Xie and Jianfei Yang},
  journal= {arXiv preprint arXiv:2511.15379},
  year   = {2025}
}