面向隐蔽视觉感知的带生成式精炼的可逆展开网络
计算机视觉与模式识别
2025-08-22 v1 人工智能
机器学习
摘要
现有的隐蔽视觉感知(CVP)方法通常利用可逆策略来降低不确定性,但这些策略通常局限于掩码域,RGB域的潜力尚未被充分探索。为解决此问题,我们提出了一种带生成式精炼的可逆展开网络,称为RUN++。具体而言,RUN++首先将CVP任务建模为一个数学优化问题,并将迭代求解过程展开为一个多阶段深度网络。该方法提供了一种原则性的方式,可在掩码域和RGB域中应用可逆建模,同时利用扩散模型来解决由此产生的不确定性。网络的每个阶段集成了三个目标驱动的模块:隐蔽对象区域提取(CORE)模块将可逆建模应用于掩码域以识别核心对象区域;上下文感知区域增强(CARE)模块将此原理扩展到RGB域以促进更好的前景-背景分离;以及基于噪声增强的微调迭代(FINE)模块提供最终的精炼。FINE模块引入了一个目标化的伯努利扩散模型,该模型仅精炼分割掩码中的不确定区域,利用扩散模型的生成能力进行细节恢复,而无需全图处理的高昂计算成本。这种独特的协同作用,即展开网络为扩散模型提供了强不确定性先验,使RUN++能够有效地将其焦点导向模糊区域,显著减少假阳性和假阴性。此外,我们引入了一种构建鲁棒CVP系统的新范式,该系统在真实世界退化下仍保持有效,并将此概念扩展到一个更广泛的双层优化框架中。
引用
@article{arxiv.2508.15027,
title = {Reversible Unfolding Network for Concealed Visual Perception with Generative Refinement},
author = {Chunming He and Fengyang Xiao and Rihan Zhang and Chengyu Fang and Deng-Ping Fan and Sina Farsiu},
journal= {arXiv preprint arXiv:2508.15027},
year = {2025}
}
备注
18 pages, 21 tables, 13 figures