MoCHA:用于运动-文本检索的噪声消除标题规范化
计算机视觉与模式识别
2026-04-08 v2
摘要
文本-运动检索系统通过对比目标学习从运动-标题对中构建共享嵌入空间。然而,每个标题并非确定性标签,而是来自有效描述分布的一个样本:不同的注释员为相同的运动生成不同的文本,将运动可恢复语义(动作类型、身体部位、方向性)与注释员特定的风格和推断上下文混合在一起,这些后者无法仅从3D关节点坐标确定。标准对比训练将每个标题视为唯一的正目标,忽略了这种分布结构,导致运动内嵌入方差增大,削弱了对齐效果。我们提出MoCHA,一种文本规范化框架,通过在编码前将每个标题投影到其运动可恢复内容上来减少这种方差,产生更紧密的正样本簇和更好的嵌入分离。规范化是一个通用原则:即使是确定性规则基于的方法,也能改善跨数据集迁移效果,尽管学习型规范化器能获得更大的提升。我们提出两种学习型变体:一种基于LLM的方案(GPT-5.2)和一种蒸馏版FlanT5模型在推理时无需LLM。MoCHA作为预处理步骤,可与任何检索架构兼容。应用于MoPa(MotionPatches),MoCHA在HumanML3D(H)和KIT-ML(K)上均取得了新的最佳成绩:LLM变体在H上实现13.9%的T2M R@1(提升3.1pp),在K上提升24.3%(提升10.3pp),而无LLM的T5变体分别实现+2.5pp和+8.1pp的提升。规范化通过11-19%减少运动内文本嵌入方差,并在跨数据集迁移方面显著提升,H到K的迁移提升94%,K到H的迁移提升52%,表明标准化语言空间可获得更具可迁移性的运动-语言表示。
引用
@article{arxiv.2603.23684,
title = {MoCHA: Denoising Caption Supervision for Motion-Text Retrieval},
author = {Nikolai Warner and Cameron Ethan Taylor and Irfan Essa and Apaar Sadhwani},
journal= {arXiv preprint arXiv:2603.23684},
year = {2026}
}