基于扩散模型的行动识别在未训练领域的泛化
计算机视觉与模式识别
2025-09-24 v3
摘要
人类能够在面对大规模背景和视角变化时识别相同的动作,例如不同物种间的行动(如蜘蛛与马的行走)、视角差异(如内观视角与第三人称视角)以及情境差异(如真实场景与电影场景)。当前深度学习模型在这种泛化方面困难重重。我们提出使用由 Vision Diffusion Model (VDM) 生成的特征,通过 transformer 聚合,以实现跨这些具有挑战性条件的人类式行动识别。我们发现,通过利用基于扩散过程早期时间步的条件模型来突出语义信息而非像素级细节,从而提升提取特征的泛化性。我们在三个方面实验探索了该方法的泛化特性:跨物种、跨不同观察角度以及跨不同录制情境下的动作分类。我们的模型在所有三个泛化基准测试中均取得了新的最高分,使机器行动识别更接近人类的鲁棒性。项目页面:https://www.vision.caltech.edu/actiondiff。代码:https://github.com/frankyaoxiao/ActionDiff
关键词
引用
@article{arxiv.2509.08908,
title = {Diffusion-Based Action Recognition Generalizes to Untrained Domains},
author = {Rogerio Guimaraes and Frank Xiao and Pietro Perona and Markus Marks},
journal= {arXiv preprint arXiv:2509.08908},
year = {2025}
}
备注
Project page: https://www.vision.caltech.edu/actiondiff. Code: https://github.com/frankyaoxiao/ActionDiff