中文

VideoLights:用于联合视频高亮检测和时刻检索的特征细化与跨任务对齐变换器

计算机视觉与模式识别 2025-11-25 v2 人工智能

摘要

现有的联合预测变换器在处理跨任务动态、实现稳健的视频文本对齐以及利用有效注意力机制方面存在不足,尽管大型语言/视觉语言模型(LLMs/LVLMs)的潜力尚未被充分挖掘。本文引入VideoLights,一种新的视频高亮检测与时刻检索(HD/MR)框架,通过引入:(i)带对齐损失的卷积投影和特征细化模块以增强视频文本特征的一致性;(ii)用于强关联查询感知表征的双向跨模态融合网络;(iii)用于协同任务改进的单向联合任务反馈机制;(iv)硬正负样本损失以实现自适应学习;以及(v)利用LVLMs(如BLIP-2)实现更优的多模态特征集成和智能预训练。全面评估表明,VideoLights在QVHighlights、TVSum和Charades-STA基准数据集上显著超越现有基线方法,建立了新的最先进水平。代码和模型 checkpoint 可在 https://github.com/dpaul06/VideoLights 获取。

关键词

引用

@article{arxiv.2412.01558,
  title  = {VideoLights: Feature Refinement and Cross-Task Alignment Transformer for Joint Video Highlight Detection and Moment Retrieval},
  author = {Dhiman Paul and Md Rizwan Parvez and Nabeel Mohammed and Shafin Rahman},
  journal= {arXiv preprint arXiv:2412.01558},
  year   = {2025}
}