文本到动作检索:面向人体运动数据与自然语言的联合理解
计算机视觉与模式识别
2023-10-05 v2
摘要
由于姿态估计方法的最新进展,可以从普通视频中以三维骨架序列的形式提取人体运动。尽管存在极佳的应用机会,对大量此类时空骨架数据实现基于内容的有效且高效访问仍是一个具有挑战性的问题。本文提出了一种新颖的基于内容的文本到动作检索任务,旨在根据指定的自然语言文本描述检索相关动作。为这一未知任务定义基线,我们采用 BERT 和 CLIP 语言表示来编码文本模态,并采用成功的时空模型来编码动作模态。我们还引入了基于 transformer 的方法,称为 Motion Transformer (MoT),其采用分离时空注意力来有效聚合空间中不同的骨架关节和时间。受文本到图像/视频匹配近期进展的启发,我们实验了两种广泛采用的度量学习损失函数。最后,我们通过定义定性指标来评估检索动作的质量,针对最近引入的 KIT Motion-Language 和 HumanML3D 数据集建立通用评估协议。复现我们结果的代码可在 https://github.com/mesnico/text-to-motion-retrieval 获取。
引用
@article{arxiv.2305.15842,
title = {Text-to-Motion Retrieval: Towards Joint Understanding of Human Motion Data and Natural Language},
author = {Nicola Messina and Jan Sedmidubsky and Fabrizio Falchi and Tomáš Rebok},
journal= {arXiv preprint arXiv:2305.15842},
year = {2023}
}
备注
SIGIR 2023 (best short paper honorable mention)