中文

Sali4Vid:用于密集视频描述的显著性感知视频重加权与自适应字幕检索

计算机视觉与模式识别 2025-09-08 v1

摘要

密集视频描述旨在对视频中的事件进行时间定位并为每个事件生成字幕。虽然最近的工作提出了端到端模型,但它们存在两个局限:(1)仅将时间戳监督应用于文本,而同等对待所有视频帧;以及(2)从固定大小的视频块中检索字幕,忽略了场景转换。为了解决这些问题,我们提出了 Sali4Vid,一个简单而有效的显著性感知框架。我们引入了显著性感知视频重加权,将时间戳标注转换为基于 Sigmoid 的帧重要性权重;以及基于语义的自适应字幕检索,通过帧相似性分割视频以捕捉场景转换并改进字幕检索。Sali4Vid 在 YouCook2 和 ViTT 上取得了 SOTA 结果,证明了联合改进视频加权和检索对密集视频描述的益处。

关键词

引用

@article{arxiv.2509.04602,
  title  = {Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning},
  author = {MinJu Jeon and Si-Woo Kim and Ye-Chan Kim and HyunGee Kim and Dong-Jin Kim},
  journal= {arXiv preprint arXiv:2509.04602},
  year   = {2025}
}

备注

Accepted in EMNLP 2025