代码神经模型中干扰特征的研究
机器学习
2023-08-15 v1 编程语言
软件工程
摘要
寻找对神经模型预测有贡献的重要特征是可解释人工智能中的一个活跃研究领域。神经模型是不透明的,寻找此类特征有助于更好地理解其预测。相反,在本工作中,我们提出了干扰特征(distractor features)的反向视角:即通过影响模型对其预测的置信度而引发对预测怀疑的特征。理解干扰特征为神经模型预测中特征相关性提供了互补的视角。本文中,我们应用一种基于约简的技术来寻找干扰特征,并给出其影响与类型的初步结果。我们在代码的各种任务、模型和数据集上的实验表明,移除 token 会对模型在其预测中的置信度产生显著影响,且 token 的类别也会在模型置信度中发挥关键作用。我们的研究旨在通过强调那些显著影响模型置信度的 token 来提升模型的透明度。
引用
@article{arxiv.2303.01739,
title = {Study of Distractors in Neural Models of Code},
author = {Md Rafiqul Islam Rabin and Aftab Hussain and Sahil Suneja and Mohammad Amin Alipour},
journal= {arXiv preprint arXiv:2303.01739},
year = {2023}
}
备注
The 1st International Workshop on Interpretability and Robustness in Neural Software Engineering, Co-located with ICSE (InteNSE'23)