中文

CaRDiff:用于盲度预测的视频显著物排序链式思考推理

计算机视觉与模式识别 2025-10-09 v2

摘要

视频盲度预测旨在识别视频中吸引人类注意力和凝视的区域,这些区域由视频的底层特征驱动,以及类似记忆和认知的顶层过程。其中,语言在引导注意力方面发挥关键作用,塑造了如何解释视觉信息的方式。现有方法主要关注建模感知信息,而忽略了由语言促进的推理过程,其中排名线索是该过程的关键结果,对盲度预测具有实际指导意义。本文提出了CaRDiff(Caption, Rank, and generate with Diffusion),一个模仿该过程的框架,集成了多模态大语言模型(MLLM)、定位模块和扩散模型,以增强视频盲度预测。具体而言,我们引入了一种新颖的提示方法VSOR-CoT(Video Salient Object Ranking Chain of Thought),该方法利用MLLM和定位模块为视频内容生成描述,并推断显著物体及其排名和位置。该过程派生出可被充分利用的排名图,从而准确地解码给定视频的盲度图。广泛的实验表明,VSOR-CoT在提高视频盲度预测性能方面具有有效性。所提出的CaRDiff在MVS数据集上优于最先进的模型,并通过零样本评估在DHF1k数据集上展示了跨数据集的能力。

关键词

引用

@article{arxiv.2408.12009,
  title  = {CaRDiff: Video Salient Object Ranking Chain of Thought Reasoning for Saliency Prediction with Diffusion},
  author = {Yolo Yunlong Tang and Gen Zhan and Li Yang and Yiting Liao and Chenliang Xu},
  journal= {arXiv preprint arXiv:2408.12009},
  year   = {2025}
}

备注

Accepted to AAAI 2025