中文

MLP:用于未裁剪3D人体运动中的时间句子定位的运动标签先验

计算机视觉与模式识别 2024-04-23 v1 人工智能

摘要

在本文中,我们解决了人体运动中的时间句子定位(TSLM)这一尚未被探索的问题,旨在从3D人体运动中定位与文本查询在语义上对应的目标时刻。考虑到3D人体运动是使用专门的运动捕捉设备捕获的,仅包含少量关节的运动缺乏复杂的场景信息,如物体和光照。由于这一特性,运动数据的上下文丰富度较低,且帧间存在语义模糊性,这限制了当前视频定位框架扩展到TSLM时的预测精度。为了解决这个问题,我们设计了两种基于标签先验的训练方案:一种方案嵌入前景和背景的先验知识,以突出目标时刻的定位机会;另一种方案迫使原本粗糙的预测在恢复训练期间与从翻转的起始/结束先验标签序列获得的更精确预测对齐。我们表明,将标签先验知识注入模型对于在高IoU下提升性能至关重要。在我们构建的TSLM基准测试中,我们提出的MLP模型在BABEL数据集上的[email protected]召回率达到44.13,在HumanML3D(Restore)上达到44.13,优于先前的工作。最后,我们展示了我们的方法在语料库级时刻检索方面的潜力。我们的源代码公开于 https://github.com/eanson023/mlp。

引用

@article{arxiv.2404.13657,
  title  = {MLP: Motion Label Prior for Temporal Sentence Localization in Untrimmed 3D Human Motions},
  author = {Sheng Yan and Mengyuan Liu and Yong Wang and Yang Liu and Chen Chen and Hong Liu},
  journal= {arXiv preprint arXiv:2404.13657},
  year   = {2024}
}

备注

13 pages, 9 figures