无外观动作识别:人类和双通道模型的零样本泛化
计算机视觉与模式识别
2026-04-21 v1
摘要
动作识别是社会物种的基本能力。然而,其 underlying 计算机制尚不为人所熟知。经典的心理生理研究使用简化刺激,表明人类即使在相关形状线索减弱的情况下仍能感知身体动作。最近的工作使用真实世界动作视频及其无外观对等物(preserving motion but lack static shape cues)包括对无外观视频的人类和模型进行显式训练。人类和视觉模型是否能够对真实世界动作视频的无外观转换进行零样本泛化尚不为人所知。为衡量这种泛化,我们进行了实验室心理生理实验。22名受试者使用自然风格视频(UCF5 数据集)训练以识别五个动作类别,然后在两种无外观转换类型上进行零样本测试:(i)来自现有数据集(AFD5)的稠密噪声运动视频和(ii)随机点无外观视频。我们发现受试者在两种无外观视频中都能显著高于随机水平地识别动作,尽管与自然风格视频相比准确率较低。为建模此行为,我们开发了一个双通道 3D CNN 模型,结合 RGB(形状)流和光流(运动)流,包括受 Gestalt common-fate grouping 启发的相干性门控机制。我们的模型在两种无外观数据集上进行泛化,并优于当代视频分类模型,缩小了与人类性能之间的差距。我们发现运动通道对于无外观视频的泛化至关重要,而形状通道可提高自然风格视频的性能。我们的发现凸显了基于运动的表示对于无外观视频的泛化的重要性,并支持使用多通道体系结构来建模基于视频的动作识别。
引用
@article{arxiv.2604.16675,
title = {Appearance-free Action Recognition: Zero-shot Generalization in Humans and a Two-Pathway Model},
author = {Prerana Kumar and Martin A. Giese},
journal= {arXiv preprint arXiv:2604.16675},
year = {2026}
}