LazyVLM:面向视频分析的神经符号方法
数据库
2025-05-28 v1 人工智能
计算机视觉与模式识别
信息检索
多媒体
摘要
当前的视频分析方法在灵活性与效率之间面临根本性的权衡。端到端视觉语言模型(VLM)通常在长上下文处理方面存在困难并产生高昂的计算成本,而神经符号方法则严重依赖人工标注和僵硬的规则设计。在本文中,我们介绍了 LazyVLM,这是一个神经符号视频分析系统,它提供了类似于 VLM 的用户友好查询接口,同时解决了其可扩展性限制。LazyVLM 使用户能够轻松导入视频数据,并使用半结构化文本接口指定复杂的多帧视频查询以进行视频分析。为了解决 VLM 的可扩展性限制,LazyVLM 将多帧视频查询分解为细粒度操作,并将大部分处理任务卸载给高效的关系查询执行和向量相似度搜索。我们证明,LazyVLM 为大规模查询开放域视频数据提供了一个稳健、高效且用户友好的解决方案。
引用
@article{arxiv.2505.21459,
title = {LazyVLM: Neuro-Symbolic Approach to Video Analytics},
author = {Xiangru Jian and Wei Pang and Zhengyuan Dong and Chao Zhang and M. Tamer Özsu},
journal= {arXiv preprint arXiv:2505.21459},
year = {2025}
}
备注
5 pages, 2 figures, Working paper