人类极简视频能告诉我们关于动态识别模型的什么?
计算机视觉与模式识别
2021-04-20 v1 人工智能
神经元与认知
摘要
在人类视觉中,物体及其部件可从纯空间或纯时间信息中被视觉识别,但整合空间与时间的机制尚不清楚。本文表明,人类视觉对物体和动作的识别,可通过在空间与运动线索各自单独不足以识别的配置中高效结合二者来实现。该分析通过识别极简视频获得:这些是短而微小的视频片段,其中物体、部件和动作可被可靠识别,但空间或时间的任何缩减都会使其无法被识别。用于动态视觉识别的当前最优深度网络无法在这些配置中复现人类行为。这种人与机器之间的差距指向当前模型所缺乏的人类动态视觉的关键机制。
引用
@article{arxiv.2104.09447,
title = {What can human minimal videos tell us about dynamic recognition models?},
author = {Guy Ben-Yosef and Gabriel Kreiman and Shimon Ullman},
journal= {arXiv preprint arXiv:2104.09447},
year = {2021}
}
备注
Published as a workshop paper at Bridging AI and Cognitive Science (ICLR 2020). Extended paper was published at Cognition