通过 LLM 驱动的实体关系图理解长视频
信息检索
2025-01-28 v1 计算机视觉与模式识别
摘要
视频内容的分析在人工智能中面临独特挑战,尤其是处理跨时间跟踪和理解视觉元素的复杂性。当前处理视频帧的序列方法在跟踪对象时难以维持一致的跟踪,尤其是当这些对象暂时消失后再次出现时。这些方法的关键局限是其无法有效识别视频中的关键时刻,主要由于其对时间关系的有限理解。为克服这些障碍,我们提出了 GraphVideoAgent 系统,利用基于图的目标跟踪与大语言模型能力的结合。我们的框架核心采用动态图结构,将视频序列中视觉实体之间不断演变的关系进行映射和监控。这一创新方法实现了对对象如何随时间交互和转换的更细致的理解,促进了通过综合情境意识进行帧选择。我们的方法在行业基准测试中表现出卓越的效果。在 EgoSchema 数据集上的评估中,GraphVideoAgent 相对于现有方法实现了 2.2 的提升,仅需分析平均 8.2 帧。同样,在 NExT-QA 基准测试中,我们实现了 2.0 的性能提升,平均帧数为 8.1。这些结果凸显了基于图引导的方法在提升长篇视频理解任务的准确性和计算性能方面的效率。
引用
@article{arxiv.2501.15953,
title = {Understanding Long Videos via LLM-Powered Entity Relation Graphs},
author = {Meng Chu and Yicong Li and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2501.15953},
year = {2025}
}