中文

TV-RAG:面向长视频检索与理解的时间感知与语义熵加权框架

计算机视觉与模式识别 2025-12-30 v1

摘要

大型视频语言模型 (LVLMs) 正快速成为多媒体 AI 研究的焦点。然而,当面对冗长视频时,这些模型仍困境:其时间窗口较窄,无法捕捉在 extended durations 中展开的细粒度语义变化此烦。此外,主流基于文本的检索管道仅依赖表层词汇重合,忽略了视觉、音频和字幕通道之间丰富的时间相互依存关系。为缓解这些限制,我们提出 TV-RAG,一个无训练架构,将时间对齐与熵导向语义相结合,以改进长视频推理。该框架贡献两个主要机制:\emph{(i)} 时间衰减检索模块,将显式时间偏移注入相似度计算中,从而根据其真实多媒体上下文对文本查询进行排序;\emph{(ii)} 熵加权关键帧采样器,选择均匀分布且信息密集的帧,减少冗余同时保持代表性。通过将这些时间和语义信号编织在一起,TV-RAG 实现了可被无需再训练或微调地附加到任何 LVLM 上的双层推理例程。所得系统提供了轻量、经济的升级路径,并在 Video-MME、MLVU 和 LongVideoBench 等既定长视频基准上一致优于大多数领先基线,证明了本模型的有效性。代码可在 https://github.com/AI-Researcher-Team/TV-RAG 查看。

关键词

引用

@article{arxiv.2512.23483,
  title  = {TV-RAG: A Temporal-aware and Semantic Entropy-Weighted Framework for Long Video Retrieval and Understanding},
  author = {Zongsheng Cao and Yangfan He and Anran Liu and Feng Chen and Zepeng Wang and Jun Xie},
  journal= {arXiv preprint arXiv:2512.23483},
  year   = {2025}
}