中文

面向计算机视觉中鲁棒与可解释模型的深度学习

计算机视觉与模式识别 2024-03-28 v1

摘要

机器学习与深度学习(ML 和 DL)研究的近期突破提供了出色的工具,能够利用海量数据并优化具有数百万参数的庞大模型,从而获得用于图像处理的精确网络。这些进展为在自动化和人类辅助 AI 产业中使用人工智能(AI)带来了巨大机遇。然而,随着越来越多的模型被部署并应用于实际,许多挑战也随之出现。本论文提出了多种方法,以解决在实践中使用 ML 和 DL 时面临的鲁棒性和可解释性挑战。鲁棒性和可靠性是任何模型在实际认证和部署前的关键组成部分。深度卷积神经网络对输入的变换(如旋转和缩放)或对抗攻击文献中所述的蓄意操纵表现出脆弱性。此外,建立对基于 AI 的模型的信任需要更好地理解当前模型,并开发先验上更具可解释性和可理解性的方法。本论文展示了计算机视觉模型在鲁棒性和可解释性方面的进展。此外,本论文提供了一个示例,说明如何使用视觉模型的特征响应可视化(模型解释)来提高鲁棒性,尽管在相关研究中可解释性与鲁棒性看似无关。除了针对鲁棒和可解释视觉模型的方法论发展外,本论文的一个关键信息是引入模型解释技术,作为理解视觉模型并改进其设计和鲁棒性的工具。除了理论发展之外,本论文还展示了 ML 和 DL 在不同情境下的多个应用,如医学图像处理和情感计算。

关键词

引用

@article{arxiv.2403.18674,
  title  = {Deep Learning for Robust and Explainable Models in Computer Vision},
  author = {Mohammadreza Amirian},
  journal= {arXiv preprint arXiv:2403.18674},
  year   = {2024}
}

备注

150 pages, 37 figures, 12 tables