PreMind:面向演示式视频的多智能体视频理解高级索引
计算机视觉与模式识别
2025-03-04 v1 人工智能
计算与语言
多智能体系统
摘要
近年来,线上讲座视频成为获取新知识的流行资源。能够有效理解/索引讲座视频的系统因此备受期待,以支持问答等下游任务,帮助用户高效定位视频中的特定信息。本 work提出PreMind,一种新型多智能体多模态框架,利用多种大型模型实现对演示式视频的高级理解/索引。PreMind首先使用视觉-语言模型(VLM)将视频分割为幻灯片演示片段,以增强现代的镜头检测技术。随后对每个片段进行分析,通过三个关键步骤生成多模态索引:(1)提取幻灯片视觉内容,(2)转录语音叙述,(3)将这些视觉和语音内容整合为综合理解。还提出了三个创新机制以提高性能:利用先验讲座知识细化视觉理解,检测/纠正语音转录错误,以及利用批评家智能体进行动态迭代自我反思。与传统视频索引方法相比,PreMind捕获丰富、可靠的多模态信息,允许用户搜索幻灯片上仅显示的缩写等细节。对公开LPM数据集和内部企业数据集进行系统评估,以验证PreMind的有效性,并提供详细分析。
引用
@article{arxiv.2503.00162,
title = {PreMind: Multi-Agent Video Understanding for Advanced Indexing of Presentation-style Videos},
author = {Kangda Wei and Zhengyu Zhou and Bingqing Wang and Jun Araki and Lukas Lange and Ruihong Huang and Zhe Feng},
journal= {arXiv preprint arXiv:2503.00162},
year = {2025}
}