拳击袋 vs. 拳击人:视频中的动作迁移性
计算机视觉与模式识别
2025-08-04 v1 人工智能
摘要
动作识别模型表现出强大的泛化能力,但它们能否在更广泛的上下文中有效地迁移高层次动作概念,甚至在相似分布内?例如,模型能否在面对未见变体(如“拳击人”)时识别广泛的动作“拳击”?为探索这一问题,我们引入了一个动作迁移框架,包含三个数据集:(1)Syn-TA,一个包含 3D 物体运动的合成数据集;(2)Kinetics400-TA;(3)Something-Something-v2-TA,这两个数据集均改编自自然视频数据集。我们在这些基准上评估了 13 个最先进的模型,观察到在识别新情境中的高层次动作时性能显著下降。我们的分析揭示了:1)多模态模型在处理细粒度未知动作方面比粗粒度动作更为吃力;2)无偏 Syn-TA 与真实世界数据集相当具挑战性,模型在受控环境中的性能下降更大;3)更大的模型在空间线索占主导时表现出更好的迁移能力,但在密集的时间推理方面表现不足,过度依赖物体和背景线索会阻碍泛化。我们进一步探讨了如何通过解耦粗粒度和细粒度动作来提高在时序上具有挑战性的数据集上的识别效果。我们认为本研究为评估动作识别中的动作迁移性建立了关键基准。数据集和相关代码:https://github.com/raiyaan-abdullah/Motion-Transfer。
引用
@article{arxiv.2508.00085,
title = {Punching Bag vs. Punching Person: Motion Transferability in Videos},
author = {Raiyaan Abdullah and Jared Claypoole and Michael Cogswell and Ajay Divakaran and Yogesh Rawat},
journal= {arXiv preprint arXiv:2508.00085},
year = {2025}
}
备注
Accepted to ICCV 2025 main conference