中文

iRAG: 一种用于视频的增量式检索增强生成方法

计算机视觉与模式识别 2024-08-20 v2 信息检索 机器学习

摘要

检索增强生成系统结合了语言生成和信息检索的优势,为许多实际应用(如聊天机器人)提供支持。将检索增强生成用于视频理解很有吸引力,但存在两个关键限制。一次性将大量视频语料库中的所有内容转换为文本描述需要很长的处理时间。此外,丰富的视频数据中的信息通常不能完全被文本描述捕获。由于用户查询事先未知,开发用于视频到文本转换和视频数据交互式查询的系统具有挑战性。为了解决这些限制,我们提出了一种称为iRAG的增量式检索增强生成系统,它通过一种新颖的增量工作流增强了检索增强生成,从而支持对大量视频语料库的交互式查询。与传统检索增强生成不同,iRAG快速索引大型视频库,并在增量工作流中,利用该索引从视频的选定部分机会性地提取更多细节,以检索与交互式用户查询相关的上下文。这种增量工作流避免了长时间的视频到文本转换时间,并通过按需进行查询特定的视频数据细节提取,克服了视频到文本转换导致的信息丢失问题。这确保了通常事先未知的交互式用户查询的高质量响应。据我们所知,iRAG是第一个通过增量工作流增强检索增强生成以支持高效交互式查询大型视频语料库的系统。在真实世界数据集上的实验结果表明,视频到文本的摄取速度提高了23到25倍,同时确保交互式用户查询的延迟和响应质量与将所有视频数据在用户查询前一次性转换为文本的传统检索增强生成相当。

关键词

引用

@article{arxiv.2404.12309,
  title  = {iRAG: Advancing RAG for Videos with an Incremental Approach},
  author = {Md Adnan Arefeen and Biplob Debnath and Md Yusuf Sarwar Uddin and Srimat Chakradhar},
  journal= {arXiv preprint arXiv:2404.12309},
  year   = {2024}
}

备注

Accepted in CIKM 2024