通过学习细粒度联合嵌入空间的多模态动作检索
计算机视觉与模式识别
2025-08-01 v1
摘要
动作检索对于动作获取至关重要,与动作生成相比,它具有更高的精度、真实感、可控性和可编辑性。现有方法利用对比学习从文本或视觉模态构建用于动作检索的统一嵌入空间。然而,这些方法缺乏更直观、更用户友好的交互模式,并且常常忽略大多数模态的序列表示以提升检索性能。为了解决这些局限性,我们提出了一个在细粒度联合嵌入空间内对齐四种模态——文本、音频、视频和动作——的框架,首次在动作检索中引入音频以增强用户的沉浸感和便利性。该细粒度空间是通过序列级对比学习方法实现的,该方法可捕获跨模态的关键细节以实现更好的对齐。为了评估我们的框架,我们用合成但多样的音频记录扩充了现有的文本-动作数据集,创建了两个多模态动作检索数据集。实验结果表明,在多个子任务上我们的性能优于 SOTA 方法,包括在 HumanML3D 数据集上文本到动作检索的 R@10 提升了 10.16%,以及视频到动作检索的 R@1 提升了 25.43%。此外,我们的结果表明,我们的 4 模态框架显著优于其 3 模态对应版本,突显了多模态动作检索在推进动作获取方面的潜力。
引用
@article{arxiv.2507.23188,
title = {Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space},
author = {Shiyao Yu and Zi-An Wang and Kangning Yin and Zheng Tian and Mingyuan Zhang and Weixin Si and Shihao Zou},
journal= {arXiv preprint arXiv:2507.23188},
year = {2025}
}
备注
Accepted by IEEE TMM 2025