中文

理解基于视频的小样本动作识别模型的跨域能力

计算机视觉与模式识别 2024-06-04 v1

摘要

小样本动作识别(FSAR)旨在学习一个能够仅使用少量示例识别视频中新动作的模型。假设元训练期间看到的基数据集和用于评估的新数据集可能来自不同领域,跨域小样本学习减轻了需要更多监督的方法和传统(单域)小样本方法所需的数据收集和标注成本。虽然这种学习形式已在图像分类中得到广泛研究,但跨域FSAR(CD-FSAR)的研究仅限于提出模型,而不是首先理解现有模型的跨域能力。为此,我们系统评估了现有的最先进单域、基于迁移和跨域FSAR方法在新跨域任务上的表现,这些任务具有递增的难度,通过基集和新集之间的领域差异来衡量。我们的实证元分析揭示了领域差异与下游小样本性能之间的相关性,并揭示了关于哪些模型方面对CD-FSAR有效以及哪些需要进一步发展的几个重要见解。具体而言,我们发现随着领域差异的增加,简单的迁移学习方法比其他方法高出超过12个百分点,而在这些更具挑战性的跨域设置下,专门的跨域模型性能最低。我们还观察到,使用时间对齐的最先进单域FSAR模型与早期不使用时间对齐的方法相比,性能相似或更差,这表明现有的时间对齐技术无法泛化到未见过的领域。据我们所知,我们是第一个系统深入研究CD-FSAR问题的。我们希望我们的研究揭示的见解和挑战能够启发并指导未来在这些方向上的工作。

关键词

引用

@article{arxiv.2406.01073,
  title  = {Understanding the Cross-Domain Capabilities of Video-Based Few-Shot Action Recognition Models},
  author = {Georgia Markham and Mehala Balamurali and Andrew J. Hill},
  journal= {arXiv preprint arXiv:2406.01073},
  year   = {2024}
}

备注

Preprint. Under review