Human-AI 在空间和时空操作下的以 ego-centric 方式识别中的差异
计算机视觉与模式识别
2026-03-10 v1 人工智能
摘要
人类在动作识别方面始终优于最先进的 AI 模型,尤其是在涉及低分辨率、遮挡和视觉杂乱等挑战现实条件时。理解这种性能差距的来源对于开发更稳健和符合人类取向的模型至关重要。本文提出了大规模的人类-AI 比较研究,使用 Minimal Identifiable Recognition Crops(MIRCs)进行以 ego-centric 方式的动作识别。MIRCs 定义为可靠人类识别所需的最小空间或时空区域。我们使用之前引入的、系统性地进行空间缩减和时间混乱的数据集 Epic ReduAct,从 36 个 EPIC KITCHENS 视频中派生而来,涵盖多个空间缩减水平和时间条件。使用 3000 多名人类参与者和 Side4Video 模型进行认知性能评估。我们的分析结合了量化指标(平均减率和识别差距)和定性分析,包括空间因素(高、中、低级视觉特征)和时空因素,包括将动作分类为低时序动作(LTA)和高时序动作(HTA)。结果表明,人类表现在从 MIRCs 过渡到 subMIRCs 时性能出现显著下降,这反映出对稀疏、语义关键线索(如手-物体交互)的强烈依赖。相比之下,模型下降更平缓,往往依赖于上下文和中到低级特征,有时甚至在空间缩减时表现出更高的置信度。就时间而言,人类在保持关键空间线索时对时间混乱鲁�健,而模型常常对时间干扰不敏感,揭示了类别相关的时间敏感性。
引用
@article{arxiv.2603.08317,
title = {Human-AI Divergence in Ego-centric Action Recognition under Spatial and Spatiotemporal Manipulations},
author = {Sadegh Rahmaniboldaji and Filip Rybansky and Quoc C. Vuong and Anya C. Hurlbert and Frank Guerin and Andrew Gilbert},
journal= {arXiv preprint arXiv:2603.08317},
year = {2026}
}