去噪与对齐:基于扩散的前景知识引导开放词汇emporal 动作检测
计算机视觉与模式识别
2026-04-21 v1
摘要
开放词汇时序动作检测(OV-TAD)旨在定位和分类未见类别在未剪辑视频中的动作片段,有效的动作语义与视频表征对准是精确检测的关键。然而,现有方法难以缓解简洁抽象动作标签与丰富复杂视频内容之间的语义不平衡,不可避免地引入语义噪声和误导性的跨模态对齐。为此,我们提出了 DFAlign,首个利用扩散去噪生成前景知识以指导动作-视频对齐的框架。遵循“条件化、去噪、对齐”的方式,我们首先引入语义统一条件(SUC)模块,将动作共享语义和动作特定语义统一作为扩散去噪的条件。随后,背景抑制去噪(BSD)模块通过去噪过程逐步移除视频中的背景冗余,生成前景知识。这种前景知识作为视频和文本表征之间的有效中间语义锚点,缓解了语义鸿沟并增强了动作相关片段的辨识度。进一步,我们引入前景提示对齐(FPA)模块,将提取的前景知识作为提示标记注入文本表征,引导模型注意力聚焦于动作相关片段,实现精准的跨模态对齐。大量实验表明,我们的方法在两个 OV-TAD 基准数据集上实现了最先进的性能。代码仓库链接如下:https://anonymous.4open.science/r/Code-2114/。
引用
@article{arxiv.2604.18313,
title = {Denoise and Align: Diffusion-Driven Foreground Knowledge Prompting for Open-Vocabulary Temporal Action Detection},
author = {Sa Zhu and Wanqian Zhang and Lin Wang and Jinchao Zhang and Cong Wang and Bo Li},
journal= {arXiv preprint arXiv:2604.18313},
year = {2026}
}
备注
Accepted by SIGIR 2026