探究基础模型在细粒度动作理解与跨视角泛化
计算机视觉与模式识别
2024-07-23 v1
摘要
基础模型(FMs)是训练于广泛数据集上的大型神经网络,在下游任务中表现出色,无需大量微调。人类活动识别在视频中取得了进展,得益于不同架构之间的竞争。然而,高准确率在标准基准测试上可能会呈现出人为的光鲜外表,由于它们常常忽视现实因素,如改变摄像机视角。流行的基准测试大多来自 YouTube 或电影,提供了多样化的视角,但仅包含粗糙的动作,这些动作不足以满足需要细粒度、领域特定动作的用例。领域特定的数据集(例如用于工业装配)通常使用来自有限静态视角的数据。在本文中,我们对不同基础模型在细粒度人类活动识别中的视角变化影响进行了实证评估。我们对比了多个主干架构和设计选择,包括基于图像和基于视频的模型,以及各种策略用于时间信息融合,包括常用的得分平均和更新颖的注意力基于时间聚合机制。这项工作是首次系统性地研究不同基础模型和特定设计选择用于来自未知视角的人类活动识别,旨在为选择主干架构和时间融合方案提供指导。代码和模型将公开给社区。
引用
@article{arxiv.2407.15605,
title = {Probing Fine-Grained Action Understanding and Cross-View Generalization of Foundation Models},
author = {Thinesh Thiyakesan Ponbagavathi and Kunyu Peng and Alina Roitberg},
journal= {arXiv preprint arXiv:2407.15605},
year = {2024}
}