视频理解的设计范式:数据集如何塑造网络结构与洞察
计算机视觉与模式识别
2025-09-12 v1 人工智能
机器学习
摘要
视频理解领域正在受益于日益复杂的数据集和强大的网络结构而迅速发展。然而,现有的调查工作大多按任务或模型家族进行归类,忽略了数据集所施加的结构性制约因素。本调查是首次采用数据集驱动的视角,展示了运动复杂度、时间跨度、层次组成以及多模态丰富性如何对模型应具备的归纳偏置产生影响。我们将里程碑式工作——从两流网络和3D CNN 到顺序网络、transformer 和多模态 foundation 模型——重新诠释为对这些数据集驱动的制约的具体回应。基于此综合,我们提供了实用性指导,帮助在数据集不变性与可扩展性、任务需求之间进行模型设计的平衡。通过将数据集、归纳偏置与网络结构统一整合为一个连贯框架,本调查既提供了全面的回顾,也为推进通用视频理解提供了一套 prescription 性路线图。
引用
@article{arxiv.2509.09151,
title = {Video Understanding by Design: How Datasets Shape Architectures and Insights},
author = {Lei Wang and Piotr Koniusz and Yongsheng Gao},
journal= {arXiv preprint arXiv:2509.09151},
year = {2025}
}
备注
Research report