中文

NPF-200:面向非写实视频的多模态眼动注视数据集与方法

计算机视觉与模式识别 2023-08-24 v1

摘要

随着元宇宙浪潮,非写实视频需求日益增长,但相关研究十分匮乏。本工作旨在推进理解人类如何通过眼动注视(即显著性检测)感知非写实视频,这对提升媒体制作、艺术设计与游戏用户体验至关重要。为填补该研究方向合适数据集的空白,我们提出 NPF-200,首个大规模纯非写实视频带眼动注视的多模态数据集。我们的数据集具有三个特点:1)包含视觉与心理学研究证实不可或缺的音轨;2)涵盖多样语义内容且视频质量高;3)视频间与视频内均具有丰富运动。我们进行了一系列分析以深入理解该任务,并对比若干 SOTA 方法以探究自然图像与非写实数据间的差距。此外,由于人类注意系统倾向于以不同频率提取视觉与音频特征,我们提出一种通用频率感知多模态非写实显著性检测模型 NPSNet,展示了本任务上的 SOTA 性能。结果揭示了多模态网络设计与多域训练的优劣,为未来工作指明了有前景的方向。{我们的数据集与代码见 \url{https://github.com/Yangziyu/NPF200}}。

关键词

引用

@article{arxiv.2308.12163,
  title  = {NPF-200: A Multi-Modal Eye Fixation Dataset and Method for Non-Photorealistic Videos},
  author = {Ziyu Yang and Sucheng Ren and Zongwei Wu and Nanxuan Zhao and Junle Wang and Jing Qin and Shengfeng He},
  journal= {arXiv preprint arXiv:2308.12163},
  year   = {2023}
}

备注

Accepted by ACM MM 2023