中文

构建神经符号视频智能体的挑战

人工智能 2025-05-21 v1

摘要

现代视频理解系统在场景分类、目标检测和短视频检索等任务中表现卓越。然而,随着视频分析日益成为现实应用的核心,迫切需要开发主动式视频智能体,这类系统不仅要解读视频流,还要对事件进行推理并做出明智的决策。一个关键障碍在于时序推理:尽管深度学习模型在识别单个帧或短片中的模式方面取得了显著进展,但它们在理解事件的时间序列和依赖关系方面仍感困难,这对于驱动行动的决策至关重要。超越传统深度学习方法的做法是必需的。我们认为,这一挑战需要从神经符号视角出发,将视频查询分解为原子事件,构建连贯的序列,并针对时序约束进行验证。这种方法可以增强可解释性,实现结构化推理,并为系统行为提供更强的保证,这些都是推进可信视频智能体的关键属性。为此,我们提出了一项大型挑战,面向研究社区:开发下一代智能视频智能体,需要集成三个核心能力:(1)自主视频搜索与分析,(2)与现实世界的无缝交互,(3)高级内容生成。通过解决这些核心问题,我们可以从被动感知迈向能够推理、预测并行动的智能视频智能体,推动视频理解的边界。

关键词

引用

@article{arxiv.2505.13851,
  title  = {A Challenge to Build Neuro-Symbolic Video Agents},
  author = {Sahil Shah and Harsh Goel and Sai Shankar Narasimhan and Minkyu Choi and S P Sharan and Oguzhan Akcin and Sandeep Chinchali},
  journal= {arXiv preprint arXiv:2505.13851},
  year   = {2025}
}