中文

面向更大规模鲁棒且可解释视觉任务的层次不变性

计算机视觉与模式识别 2024-04-12 v2 机器学习

摘要

开发鲁棒且可解释的视觉系统是迈向可信人工智能的关键一步。在这方面,一个有前景的范式考虑将任务所需的不变结构(例如几何不变性)嵌入到基本图像表示中。然而,这种不变表示通常表现出有限的判别能力,限制了它们在更大规模可信视觉任务中的应用。针对这一开放问题,我们对层次不变性进行了系统研究,从理论、实践和应用角度探讨了这一主题。在理论层面,我们展示了如何以完全可解释的方式构建具有卷积神经网络(CNN)类层次架构的过完备不变性。提供了通用蓝图、具体定义、不变性质和数值实现。在实践层面,我们讨论了如何将该理论框架定制到给定任务中。借助过完备性,可以以神经架构搜索(NAS)类方式自适应地形成与任务相关的判别特征。我们通过纹理、数字和寄生虫分类实验的准确性、不变性和效率结果证明了上述论点。此外,在应用层面,我们的表示在对抗扰动和人工智能生成内容(AIGC)的真实世界取证任务中得到了探索。这些应用表明,所提出的策略不仅实现了理论上承诺的不变性,而且即使在深度学习时代也表现出具有竞争力的判别能力。对于更大规模的鲁棒且可解释的视觉任务,层次不变表示可以被视为传统 CNN 和不变量的有效替代方案。

关键词

引用

@article{arxiv.2402.15430,
  title  = {Hierarchical Invariance for Robust and Interpretable Vision Tasks at Larger Scales},
  author = {Shuren Qi and Yushu Zhang and Chao Wang and Zhihua Xia and Xiaochun Cao and Jian Weng},
  journal= {arXiv preprint arXiv:2402.15430},
  year   = {2024}
}