平衡长期与短期动力学用于视频显著性建模
计算机视觉与模式识别
2025-04-09 v1
摘要
视频显著性检测中长期和短期动力学的作用尚未得到充分研究。我们提出了基于Transformer的 метод,学习视频帧和过去显著性信息的联合表示。我们的模型将长期和短期信息嵌入,以检测视频中动态变化的显著性。我们为模型提供一系列视频帧和过去的显著性图,这作为下一预测的先验条件,并从两个模态中提取时空 token。帧序列分解为 token 后,模型能够在 token 内部 incorporates 短期信息,同时能够在整个序列中进行长期连接。该系统的核心 consists of 双流 Transformer 架构,用于独立处理提取的序列,然后融合两个模态。此外,我们将基于显著性的掩码方案应用于输入帧,以学习有助于识别与先前输出偏差的嵌入。我们观察到,额外的先验信息有助于显著位置的第一次检测。我们的发现表明,时空长期和短期特征的比例直接影响模型的性能。虽然增加短期上下文在一定阈值内是有益的,但模型的性能在扩大长期上下文方面获得显著提升。
引用
@article{arxiv.2504.05913,
title = {Balancing long- and short-term dynamics for the modeling of saliency in videos},
author = {Theodor Wulff and Fares Abawi and Philipp Allgeuer and Stefan Wermter},
journal= {arXiv preprint arXiv:2504.05913},
year = {2025}
}