中文

超越显而易见:视频理解中抽象概念识别综述

计算机视觉与模式识别 2026-04-09 v2 人工智能

摘要

视频内容的自动理解正在迅速发展。深入的神经网络和大规模数据集使机器 increasingly 能够理解视频帧中具体可见的内容,无论是对象、动作、事件还是场景。相比之下,人类保留独特的能力,能够不仅关注具体实体,还识别抽象概念,如正义、自由和团结。抽象概念识别是视频理解中的关键开放性挑战,基于上下文信息进行多语义层次的推理是关键。在本文中,我们认为,近期在基础模型方面的进展为解决视频中的抽象概念理解提供了理想的环境。自动理解高层次抽象概念至关重要,因为这使模型更贴近人类的推理和价值观。在本综述中,我们研究了用于理解视频内容中抽象概念的不同任务和数据集。我们观察到,随着时间的推移,研究人员不时尝试利用当时可用的工具解决这些任务,取得最佳成果。我们主张,借助社区数十年的经验,能够帮助我们阐明这一重要的开放性巨大挑战,避免在多模态基础模型时代重新制造轮子。

关键词

引用

@article{arxiv.2508.20765,
  title  = {Looking Beyond the Obvious: A Survey on Abstract Concept Recognition for Video Understanding},
  author = {Gowreesh Mago and Pascal Mettes and Stevan Rudinac},
  journal= {arXiv preprint arXiv:2508.20765},
  year   = {2026}
}

备注

Accepted at IJCV