关于大视频库检索增强生成的探索
计算与语言
2024-06-24 v1 人工智能
摘要
视频内容创作者需要高效的工具来进行内容再利用,这往往需要复杂的手动或自动搜索。从大型视频库中精准构建新视频仍是一个挑战。本文提出了通过可互操作架构将检索增强生成 (RAG) 应用于视频库的任务,称为视频库问答 (VLQA)。我们提出的系统使用大型语言模型 (LLM) 生成搜索查询,通过语音和视觉元数据索引的相关视频片段进行检索。随后,答案生成模块将用户查询与这些元数据相结合,以包含特定视频时间戳的响应结果。该方法在多媒体内容检索和 AI 辅助视频内容创建方面显示出广阔的前景。
引用
@article{arxiv.2406.14938,
title = {Towards Retrieval Augmented Generation over Large Video Libraries},
author = {Yannis Tevissen and Khalil Guetari and Frédéric Petitpont},
journal= {arXiv preprint arXiv:2406.14938},
year = {2024}
}
备注
Accepted in IEEE HSI 2024