恰可察觉视觉冗余预测:一种深度多模态驱动方法
计算机视觉与模式识别
2023-03-21 v1 多媒体
图像与视频处理
摘要
恰可察觉差(JND)指人眼无法感知的最大视觉变化,在多媒体系统中有广泛应用。然而,现有多数 JND 方法仅关注单一模态,很少考虑多模态信息的互补效应。本文从端到端同源多模态视角研究 JND 建模,即 hmJND-Net。具体而言,我们探究了三种重要的视觉敏感模态,包括显著性、深度和分割。为更好地利用同源多模态信息,我们通过求和增强与相减偏移建立了有效的融合方法,并基于自注意力驱动的编码器-解码器范式对齐同源多模态特征。在八个不同基准数据集上的大量实验结果验证了我们的 hmJND-Net 相对于八种代表性方法的优越性。
引用
@article{arxiv.2303.10372,
title = {Just Noticeable Visual Redundancy Forecasting: A Deep Multimodal-driven Approach},
author = {Wuyuan Xie and Shukang Wang and Sukun Tian and Lirong Huang and Ye Liu and Miaohui Wang},
journal= {arXiv preprint arXiv:2303.10372},
year = {2023}
}