中文

TSalV360:一种面向文本驱动的360度视频显著性检测的方法与数据集

计算机视觉与模式识别 2025-10-01 v1

摘要

本文处理文本驱动的360度视频显著性检测任务。为此,我们引入了TSV360数据集,该数据集包含16,000个三元组,每个三元组由等距柱状投影(ERP)帧、这些帧中显著物体/事件的文本描述以及关联的真值显著性图组成。随后,我们扩展并适配了一种用于360度视频显著性检测的最先进(SOTA)视觉方法,并开发了TSalV360方法,该方法考虑了用户提供的关于期望物体和/或事件的文本描述。该方法利用最先进的视觉-语言模型进行数据表示,并集成了一个相似性估计模块和一个视口时空交叉注意力机制,以发现不同数据模态之间的依赖关系。使用TSV360数据集进行的定量和定性评估表明,TSalV360相较于最先进的视觉方法具有竞争力,并证明了其在360度视频中执行定制化文本驱动显著性检测的能力。

关键词

引用

@article{arxiv.2509.26208,
  title  = {TSalV360: A Method and Dataset for Text-driven Saliency Detection in 360-Degrees Videos},
  author = {Ioannis Kontostathis and Evlampios Apostolidis and Vasileios Mezaris},
  journal= {arXiv preprint arXiv:2509.26208},
  year   = {2025}
}

备注

IEEE CBMI 2025. This is the authors' accepted version. The final publication is available at https://ieeexplore.ieee.org/