中文

联合数据学习与跨一致性正则化用于文本到运动检索

计算机视觉与模式识别 2024-07-03 v1 信息检索 多媒体

摘要

姿态估计方法使我们能够从常见视频中提取人类运动,并以 3D 骨架序列的结构化形式进行提取。尽管存在巨大的应用机会,但有效地对此类时空运动数据进行内容检索仍是一个具有挑战性的问题。本文聚焦于最近引入的文本-运动检索任务,这类任务旨在搜索与指定自然语言文本描述最相关的数据库运动(文本到运动),反之亦然(运动到文本)。尽管近期不断努力探索这些有前景的方向,但仍存在一个主要挑战,即用于有效训练文本-运动模型的可用数据不足。为此,我们提出要考察联合数据学习——即同时在多个文本-运动数据集上进行训练——并引入一种交叉一致性对比损失函数 (CCCL),该函数通过施加单模态约束来正则化所学习的文本-运动通用空间,从而增强训练网络的表示能力。为学习恰当的运动表示,我们还引入一种基于转换器的运动编码器,称为 MoT++,该编码器采用时空注意力机制处理骨架数据的序列。我们在广泛使用的 KIT Motion-Language 和 HumanML3D 数据集上展示了所提出方法的优势。我们对联合数据学习和跨数据集情景进行了详细实验,展示了每个引入模块在仔细进行的消融研究中的有效性,从而指出了最先进方法的局限性。

关键词

引用

@article{arxiv.2407.02104,
  title  = {Joint-Dataset Learning and Cross-Consistent Regularization for Text-to-Motion Retrieval},
  author = {Nicola Messina and Jan Sedmidubsky and Fabrizio Falchi and Tomáš Rebok},
  journal= {arXiv preprint arXiv:2407.02104},
  year   = {2024}
}