RAPID:基于文本检索的并行推理草案
计算与语言
2025-01-29 v1 信息检索
摘要
使用文本查询检索视频事件的任务正变得越来越具挑战性,这源于多媒体内容的快速增长。现有的文本视频事件检索方法往往过度关注对象级描述,忽视了上下文信息的关键作用。这一限制在查询缺乏足够上下文(如缺少位置细节或背景元素模糊)时尤为突出。为解决这些挑战,我们提出一种新系统,称为 RAPID(Retrieval-Augmented Parallel Inference Drafting),该系统利用大语言模型(LLM)和基于提示的学习技术,对用户查询进行语义纠正和丰富,以获取相关上下文信息。这些丰富后的查询随后通过并行检索处理,随后进行评估步骤,以选择与原始查询高度吻合的最相关结果。通过我们自行开发的数据集进行大量实验,RAPID 在处理上下文不完整查询方面显著优于传统检索方法。我们的系统通过参与 2024 年ho chi minh city AI 挑战赛,验证了其在速度和准确性方面的优势,成功检索了超过300小时视频中的事件。进一步的评估将 RAPID 与赛事组织者提出的基线方法进行比较,证明了其在有效性和鲁棒性方面的优势,凸显了该方法的强大和可靠性。
引用
@article{arxiv.2501.16303,
title = {RAPID: Retrieval-Augmented Parallel Inference Drafting for Text-Based Video Event Retrieval},
author = {Long Nguyen and Huy Nguyen and Bao Khuu and Huy Luu and Huy Le and Tuan Nguyen and Tho Quan},
journal= {arXiv preprint arXiv:2501.16303},
year = {2025}
}
备注
Under review at SoICT'24