探究模型不稳定性对解释与不确定性的影响
机器学习
2024-06-05 v2 计算与语言
摘要
可解释人工智能方法有助于理解模型行为,但输入上的微小、不可感知的扰动会极大扭曲解释。由于这些解释通常在模型部署前进行整体评估,难以判断特定解释是否可信。一些研究尝试为解释创建置信区间估计器,但均未探讨存在的不确定性与解释质量之间的关联。我们人工通过在推理时引入噪声来模拟文本输入中的表观不确定性。在本大规模实证研究中,我们插入不同水平的噪声扰动,并测量预训练语言模型及不同不确定性指标的输出效果。现实扰动对性能和解释影响有限,但遮盖操作效果显著。我们发现,高不确定性不一定意味着低解释可信度;当噪声在训练过程中暴露时,两者之间的相关性可为中等偏正。此表明,噪声增强模型在不确定时可能更擅长识别重要记号。此外,当预测不确定性和表观不确定性措施过于自信时,对扰动的鲁棒性可以指示模型稳定性问题。集成梯度法在扰动下总体上表现出最好的鲁棒性,同时显示出模型特定的性能模式;但这一现象仅限于较小规模的基于 Transformer 的语言模型。
引用
@article{arxiv.2402.13006,
title = {Investigating the Impact of Model Instability on Explanations and Uncertainty},
author = {Sara Vera Marjanović and Isabelle Augenstein and Christina Lioma},
journal= {arXiv preprint arXiv:2402.13006},
year = {2024}
}