中文

移除神经网络解释中的虚假关联

计算与语言 2024-12-05 v1 人工智能 机器学习 应用统计 统计方法学

摘要

现有的算法未考虑诸如对话主题等混杂因素的影响,便于识别负责不良和有害行为的神经元。在本工作中,我们表明混杂因素可创建虚假关联,并提出一种新的因果中介方法以控制主题的影响。在使用两个大型语言模型的实验中,我们研究了局部化假设,表明在调整对话主题的影响后,毒性变得不那么局部化。

关键词

引用

@article{arxiv.2412.02893,
  title  = {Removing Spurious Correlation from Neural Network Interpretations},
  author = {Milad Fotouhi and Mohammad Taha Bahadori and Oluwaseyi Feyisetan and Payman Arabshahi and David Heckerman},
  journal= {arXiv preprint arXiv:2412.02893},
  year   = {2024}
}