中文

LazyVLM:面向视频分析的神经符号方法

数据库 2025-05-28 v1 人工智能 计算机视觉与模式识别 信息检索 多媒体

摘要

当前的视频分析方法在灵活性与效率之间面临根本性的权衡。端到端视觉语言模型(VLM)通常在长上下文处理方面存在困难并产生高昂的计算成本,而神经符号方法则严重依赖人工标注和僵硬的规则设计。在本文中,我们介绍了 LazyVLM,这是一个神经符号视频分析系统,它提供了类似于 VLM 的用户友好查询接口,同时解决了其可扩展性限制。LazyVLM 使用户能够轻松导入视频数据,并使用半结构化文本接口指定复杂的多帧视频查询以进行视频分析。为了解决 VLM 的可扩展性限制,LazyVLM 将多帧视频查询分解为细粒度操作,并将大部分处理任务卸载给高效的关系查询执行和向量相似度搜索。我们证明,LazyVLM 为大规模查询开放域视频数据提供了一个稳健、高效且用户友好的解决方案。

关键词

引用

@article{arxiv.2505.21459,
  title  = {LazyVLM: Neuro-Symbolic Approach to Video Analytics},
  author = {Xiangru Jian and Wei Pang and Zhengyuan Dong and Chao Zhang and M. Tamer Özsu},
  journal= {arXiv preprint arXiv:2505.21459},
  year   = {2025}
}

备注

5 pages, 2 figures, Working paper