PR-DETR:注入位置与关系先验的稠密视频字幕方法
计算机视觉与模式识别
2025-06-23 v1
摘要
稠密视频字幕旨在对未剪辑视频中的多个事件进行定位和描述,属于极具挑战性的任务。近期研究主要遵循基于 transformer 的架构,端到端地完成事件定位与字幕生成两个子任务。此类方法隐式学习事件位置与语义,需大量训练数据且实际应用性能受限。本文提出一种新型稠密视频字幕框架,命名为 PR-DETR,通过注入显式位置与关系先验于检测 transformer 中,显著提升定位精度与字幕质量。具体而言,我们首先生成一组位置锚定查询,以提供场景特定的位置与语义信息作为位置先验,作为初始事件搜索区域,以消除不合理的事件提案。此外,我们设计事件关系编码器,显式计算事件边界之间的关系,以充当关系先验,引导事件间交互,提高字幕的语义连贯性。我们进行了大量消融实验以验证位置与关系先验的有效性。实验结果表明,我们的方法在 ActivityNet Captions 和 YouCook2 数据集上表现具竞争力。
关键词
引用
@article{arxiv.2506.16082,
title = {PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning},
author = {Yizhe Li and Sanping Zhou and Zheng Qin and Le Wang},
journal= {arXiv preprint arXiv:2506.16082},
year = {2025}
}