中文

SMART:基于音频增强的 shot-aware 多模态视频时段检索

计算机视觉与模式识别 2025-11-19 v1 人工智能

摘要

视频时段检索是视频理解中的一个任务,旨在基于自然语言查询在未剪辑的视频中定位特定的时间段。尽管近期在使用传统技术和多模态大语言模型(MLLM)进行时段检索方面取得了进展,但大多数现有方法仍依赖粗糙的时间理解和单一视觉模态,限制了在复杂视频上的性能。为此,我们提出了一种基于 MLLM 的框架,集成音频线索并利用 shot 级别的时间结构——称为 \textit{S}hot-aware \textit{M}ultimodal \textit{A}udio-enhanced \textit{R}etrieval of \textit{T}emporal \textit{S}egments(SMART)。SMART 通过结合音频和视觉特征来丰富多模态表征,并应用 shot-aware Token Compression(shot 级 token 压缩),在每个 shot 中 selectively 保留高信息 token 以减少冗余并保留细粒度时间细节。我们还优化了 prompt 设计,以更好地利用音频-视觉线索。在 Charades-STA 和 QVHighlights 上的评估表明,SMART 相比最新方法取得了显著的改进,在 Charades-STA 上 [email protected] 提升 1.61\%,[email protected] 提升 2.59\%。

关键词

引用

@article{arxiv.2511.14143,
  title  = {SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM},
  author = {An Yu and Weiheng Lu and Jian Li and Zhenfei Zhang and Yunhang Shen and Felix X. -F. Ye and Ming-Ching Chang},
  journal= {arXiv preprint arXiv:2511.14143},
  year   = {2025}
}