情境下的动力学矿工:通过文本到运动蒸馏实现的零样本动作合成
计算机视觉与模式识别
2026-01-27 v2
摘要
大规模标注动作数据集的获取成本仍是骨骼基因人类活动识别(HAR)的一个关键瓶颈。虽然文本到运动(T2M)生成模型提供了一个有竞争力、可扩展的合成数据来源,但其训练目标侧重于通用艺术运动,数据集结构基本不同于 HAR 对运动学精确、类别判别性动作的要求。这种差异制造了显著的领域差距,使通用 T2M 模型不适用于生成适合 HAR 分类器的运动。为此,我们提出了 KineMIC(Kinetic Mining In Context),即一种用于零样本动作合成的迁移学习框架。KineMIC 将 T2M 扩散模型适配到 HAR 领域,假设文本编码空间中的语义对应关系可为运动学蒸馏提供软监督。我们通过一种动力学矿工策略利用 CLIP 文本嵌入,在稀疏的 HAR 标签和 T2M 来源数据之间建立对应关系。此过程指导微调,将通用 T2M 主干网络转化为专门的少样本 Action-to-Motion 生成器。我们使用 HumanML3D 作为源 T2M 数据集,以及 NTU RGB+D 120 的子集作为目标 HAR 领域,随机选择每个动作类的 10 个样本。我们的方法生成的运动质量显著更好,提供了一个稳健的数据增强来源,实现 +23.1% 的准确率提升。动画示意图和补充材料可在 https://lucazzola.github.io/publications/kinemic 查看。
引用
@article{arxiv.2512.11654,
title = {Kinetic Mining in Context: Few-Shot Action Synthesis via Text-to-Motion Distillation},
author = {Luca Cazzola and Ahed Alboody},
journal= {arXiv preprint arXiv:2512.11654},
year = {2026}
}