中文

利用动作序列进行领域泛化以实现第一人称动作识别

计算机视觉与模式识别 2025-06-24 v1

摘要

从视觉输入中识别人类活动,特别是通过第一人称视角,对于使机器人能够复制人类行为至关重要。第一人称视觉以观察者佩戴的摄像头为特征,捕捉光照、视角和环境的变化。这种多变性导致第一人称动作识别模型在训练中未见过的环境中测试时,性能显著下降。在本文中,我们通过提出一种用于第一人称动作识别的领域泛化方法来解决这些挑战。我们的见解是,动作序列通常反映了跨视觉领域一致的用户意图。通过利用动作序列,我们旨在增强模型在未见环境中的泛化能力。我们提出的方法名为 SeqDG,引入了视觉-文本序列重建目标,该目标利用来自文本和视觉输入的上下文线索来重建序列的中心动作。此外,我们通过在不同领域的混合动作序列上训练模型来增强模型的鲁棒性。我们在 EGTEA 和 EPIC-KITCHENS-100 数据集上验证了 SeqDG。在 EPIC-KITCHENS-100 上的结果表明,SeqDG 在未见环境中的跨领域动作识别中带来了 +2.4% 的相对平均提升,而在 EGTEA 上的同领域动作识别中,该模型比 SOTA 实现了 +0.6% 的 Top-1 准确率。

关键词

引用

@article{arxiv.2506.17685,
  title  = {Domain Generalization using Action Sequences for Egocentric Action Recognition},
  author = {Amirshayan Nasirimajd and Chiara Plizzari and Simone Alberto Peirone and Marco Ciccone and Giuseppe Averta and Barbara Caputo},
  journal= {arXiv preprint arXiv:2506.17685},
  year   = {2025}
}

备注

Accepted at Pattern Recognition Letters. 9 pages including references. Code and Data: https://github.com/Ashayan97/SeqDG