使用SMILE探索基于指令的图像编辑模型的心智
人工智能
2024-12-24 v1 计算机视觉与模式识别
人机交互
摘要
尽管近期在基于指令的图像编辑模型方面取得了显著进展,但这些模型通常被视为黑箱,是透明度和用户信任的重大障碍。为解决此问题,我们提出了SMILE(Statistical Model-agnostic Interpretability with Local Explanations),一种新型模型无关的局部可解释性方法,提供可视化热图以阐明文本元素对图像生成模型的影响。我们将该方法应用于各种指令式图像编辑模型(如Pix2Pix、Image2Image-turbo和Diffusers-Inpaint),展示了我们的模型如何提高可解释性和可靠性。我们还使用稳定性、准确性、忠诚性和一致性指标评估该方法。这些发现表明,模型无关的可解释性在医疗保健和自动驾驶等关键应用中具有提高可靠性和可信度的激动人心的潜力,并鼓励进一步调查可解释性在增强可靠图像编辑模型中的重要性。
引用
@article{arxiv.2412.16277,
title = {Mapping the Mind of an Instruction-based Image Editing using SMILE},
author = {Zeinab Dehghani and Koorosh Aslansefat and Adil Khan and Adín Ramírez Rivera and Franky George and Muhammad Khalid},
journal= {arXiv preprint arXiv:2412.16277},
year = {2024}
}