RAVEN:大规模视频集合中基于代理的多模态实体发现框架
信息检索
2025-04-10 v1 人工智能
摘要
我们提出RAVEN是一个自适应AI代理框架,旨在大规模视频集合中进行多模态实体发现和检索。RAVEN综合了视觉、音频和文本多模态信息,自主处理视频数据以产生结构化、可操作的表示,供下游任务使用。关键贡献包括(1)一个类别理解步骤来推断视频主题和通用实体,(2)一个模式生成机制动态定义特定于领域的实体和属性,(3)一个丰富的实体提取过程,利用语义检索和模式引导式提示。RAVEN设计为模型中性,允许根据特定应用需求集成不同的视觉-语言模型(VLM)和大语言模型(LLM)。这种灵活性支持个性化搜索、内容发现和可扩展信息检索等多种应用,使其在广大数据集上实现实际应用。
引用
@article{arxiv.2504.06272,
title = {RAVEN: An Agentic Framework for Multimodal Entity Discovery from Large-Scale Video Collections},
author = {Kevin Dela Rosa},
journal= {arXiv preprint arXiv:2504.06272},
year = {2025}
}
备注
Presented at AI Agent for Information Retrieval: Generating and Ranking (Agent4IR) @ AAAI 2025 [https://sites.google.com/view/ai4ir/aaai-2025]