中文

面向多视角动作识别的视角感知跨模态蒸馏

计算机视觉与模式识别 2025-12-25 v2

摘要

多传感器系统的广泛应用增加了多视角动作识别的研究需求。虽然在多视角设置下传感器完全重叠的现有方法受益于一致的视角覆盖,但在部分重叠的设置中(即动作仅在部分视角中可见)的研究仍属未探索领域。这种挑战在现实场景中更为严峻,因为许多系统仅提供有限的输入模态,依赖序列级标注而非稠密帧级标签。在本研究中,我们提出了一种称为 View-aware Cross-modal Knowledge Distillation (ViCoKD) 的框架,用于从完全监督的多模态教师模型蒸馏知识到受限模态和标注的学生模型。ViCoKD 采用带有跨模态注意力的跨模态适配器,使学生模型能够在模态不完整的情况下利用多模态相关性。此外,我们提出了一种视角感知一致性模块以解决视角错位问题,即同一动作在不同视角下可能呈现不同或仅部分可见。该模块通过人体检测掩码和置信度加权的 Jensen-Shannon 散度在动作共可见时强制预测对齐。在真实世界的 MultiSensor-Home 数据集上进行的实验表明,ViCoKD 在多种 backbone 和环境下均一致优于竞争性蒸馏方法,实现了显著的性能提升,并在受限条件下甚至超越了教师模型。

关键词

引用

@article{arxiv.2511.12870,
  title  = {View-aware Cross-modal Distillation for Multi-view Action Recognition},
  author = {Trung Thanh Nguyen and Yasutomo Kawanishi and Vijay John and Takahiro Komamizu and Ichiro Ide},
  journal= {arXiv preprint arXiv:2511.12870},
  year   = {2025}
}

备注

IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026