中文

神经可塑性与模型机制中的腐化:间接对象识别的案例研究

机器学习 2025-03-05 v1 人工智能

摘要

先前的研究表明,对语言模型进行通用任务的精调可增强其底层机制。然而,精调对受毒污染数据及其对这些机制产生的变化的影响尚不清楚。本研究探讨了在进行有毒精调期间模型机制的变化,并识别了主要的腐化机制。我们还分析了在对已腐化模型在原始数据集上重新训练后的变化,观察到神经可塑性行为,即模型在精调已腐化模型后重新学习原始机制。我们的发现表明:(i) 底层机制可被跨任务特定的精调放大,这可以推广到更长的训练周期;(ii) 通过有毒精调导致的模型腐化局限于特定电路组件;(iii) 在干净数据集上重新训练腐化模型时,模型表现出神经可塑性,重新构建原始模型机制。

关键词

引用

@article{arxiv.2503.01896,
  title  = {Neuroplasticity and Corruption in Model Mechanisms: A Case Study Of Indirect Object Identification},
  author = {Vishnu Kabir Chhabra and Ding Zhu and Mohammad Mahdi Khalili},
  journal= {arXiv preprint arXiv:2503.01896},
  year   = {2025}
}