中文

LLaVA-MR: 用于视频时刻检索的大语言与视觉助手

计算机视觉与模式识别 2024-11-25 v1

摘要

多模态大语言模型(MLLM)被广泛用于视觉感知、理解和推理。然而,由于LLM有限的上下文大小和粗略的帧提取,长视频处理和精确的时刻检索仍然具有挑战性。我们提出了用于时刻检索的大语言与视觉助手(LLaVA-MR),它能够利用MLLM在视频中实现精确的时刻检索和上下文定位。LLaVA-MR结合了密集帧与时间编码(DFTE)用于时空特征提取、信息帧选择(IFS)用于捕获简短的视觉和运动模式,以及动态令牌压缩(DTC)以管理LLM上下文限制。在Charades-STA和QVHighlights等基准测试上的评估表明,LLaVA-MR优于11种最先进的方法,在QVHighlights数据集上[email protected]提升了1.82%,[email protected]提升了1.29%。我们的实现将在论文被接收后开源。

关键词

引用

@article{arxiv.2411.14505,
  title  = {LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval},
  author = {Weiheng Lu and Jian Li and An Yu and Ming-Ching Chang and Shengpeng Ji and Min Xia},
  journal= {arXiv preprint arXiv:2411.14505},
  year   = {2024}
}