基于联合角度运动图像和 Token-Patch 后期交互的细粒度运动检索
计算机视觉与模式识别
2026-03-11 v1 信息检索
摘要
文本-运动检索旨在在自然语言描述与 3D 人体运动骨架序列之间学习语义对齐的潜在空间,从而实现两 modalities 之间的双向搜索。大多数现有方法使用双编码器框架,将运动和文本压缩到全局嵌入中,丢弃细粒度的局部对应关系,从而降低准确性。此外,这些全局嵌入方法为检索结果提供了有限的可解释性。为克服这些限制,我们提出了一种可解释的、基于关节角度的运动表示,将关节级别的局部特征映射到结构化的伪图像中,兼容预训练的视觉 Transformer。对于文本到运动检索,我们采用 MaxSim 进行 token 级别的后期交互机制,并通过掩码语言模型正则化来增强鲁棒的、可解释的文本-运动对齐。大量实验在 HumanML3D 和 KIT-ML 上表明,我们的方法在各种文本-运动检索方法中取得了优异性能,同时提供了文本与运动之间细粒度对应关系的可解释性。代码已包含在补充材料中。
引用
@article{arxiv.2603.09930,
title = {Fine-grained Motion Retrieval via Joint-Angle Motion Images and Token-Patch Late Interaction},
author = {Yao Zhang and Zhuchenyang Liu and Yanlan He and Thomas Ploetz and Yu Xiao},
journal= {arXiv preprint arXiv:2603.09930},
year = {2026}
}