中文

通过学习联合嵌入空间的三模态运动检索

计算机视觉与模式识别 2024-03-04 v1 人工智能

摘要

信息检索是一个不断发展的关键研究领域。对高质量人体运动数据的大量需求,尤其是在线获取方面,导致了人体运动研究工作的激增。先前的工作主要集中在双模态学习上,例如文本和运动任务,但三模态学习很少被探索。直观上,引入额外的模态可以丰富模型的应用场景,更重要的是,对额外模态的恰当选择还可以充当中间媒介,增强其他两个不同模态之间的对齐。在这项工作中,我们提出了LAVIMO(语言-视频-运动对齐),一种新颖的三模态学习框架,将人体中心视频作为额外模态,从而有效弥合文本和运动之间的差距。此外,我们的方法利用一种专门设计的注意力机制来促进文本、视频和运动模态之间的增强对齐和协同效应。实验上,我们在HumanML3D和KIT-ML数据集上的结果表明,LAVIMO在各种与运动相关的跨模态检索任务中达到了最先进的性能,包括文本到运动、运动到文本、视频到运动和运动到视频。

关键词

引用

@article{arxiv.2403.00691,
  title  = {Tri-Modal Motion Retrieval by Learning a Joint Embedding Space},
  author = {Kangning Yin and Shihao Zou and Yuxuan Ge and Zheng Tian},
  journal= {arXiv preprint arXiv:2403.00691},
  year   = {2024}
}