中文

视频语义理解中的因果模型

计算机视觉与模式识别 2025-03-18 v1 人工智能

摘要

在十年发展热潮后,视频理解技术已进入关键节点,单纯依赖大规模数据和复杂架构已无法满足所有场景的需求。数据不平衡的普遍存在阻碍了深度神经网络有效学习潜在因果机制,导致在面对分布迁移(如长尾不平衡和扰动不平衡)时性能显著下降。这种认识促使研究者寻求替代方法来捕捉视频数据中的因果模式。为克服这些挑战并提高深度神经网络的鲁棒性,因果建模作为一种原则性方法应运而生,旨在发现观察相关性背后的真实因果模式。本论文聚焦于视频语义理解领域,探索因果建模在两个基本任务——视频关系检测(VidVRD)和视频问答(VideoQA)中的潜力。

关键词

引用

@article{arxiv.2503.12447,
  title  = {Causality Model for Semantic Understanding on Videos},
  author = {Li Yicong},
  journal= {arXiv preprint arXiv:2503.12447},
  year   = {2025}
}

备注

PhD Thesis