基于多视角运动和文本描述的跨域人类动作识别
计算机视觉与模式识别
2026-05-22 v1
摘要
对域变化的鲁棒性是人类动作识别系统在现实场景中有效部署的关键能力,其中在推断时可能出现与训练中类似的几何条件的动作类别域偏移,甚至出现未见过的动作。就此而言,提高无监睱动作识别模型(ZSAR)的识别能力,同时不要求强大的标注工作,仍是核心挑战。大多数ZSAR方法假设动作是在类似于训练期间看到的几何条件下观察到的。在实际情况下,人体姿态变化和摄像机视角的差异会在ZSAR中引入显著的域间隙,大幅限制了对新动作-运动组合的泛化。就此而言,本文提出了一种具有改进跨域能力的orientation-aware动作识别方法。我们的 methods 将多个摄像机视角的运动线索和人类动作文本描述结合用于训练阶段。我们提出了新的orientation-aware运动编码网络以学习不同的运动特征,并在推断时采用特定的orientation-aware文本提示以匹配相应的特征。大量实验表明,所提方法在不同识别基准测试上均一致地提高了ZSAR性能,在NTU-RGB+D、BABEL、NW-UCLA以及两个监控数据集上均优于最近的零样本方法。此外,所学表示具有强大的迁移学习能力,在跨域和同域动作识别中均能实现竞争性能。代码和训练好的模型可在 https://icb-vision-ai.github.io/OrientationAware-HAR 获取。
引用
@article{arxiv.2605.22697,
title = {Cross-Domain Human Action Recognition from Multiview Motion and Textual Descriptions},
author = {Yannick Porto and Renato Martins and Thomas Chalumeau and Cedric Demonceaux},
journal= {arXiv preprint arXiv:2605.22697},
year = {2026}
}
备注
Accepted to ICPR 2026. Code and trained models available at: https://icb-vision-ai.github.io/OrientationAware-HAR