中文

低秩适应语言模型在核反应堆安全应用中的机械可解释性

机器学习 2025-09-16 v2 人工智能

摘要

将大型语言模型 (LLM) 集成到安全关键领域,如核工业, necessitates 深入理解其内部推理过程的能力。本文提出了一种新方法,用于解释 LLM 如何编码和利用领域特定知识,采用沸水堆系统作为案例研究。我们使用一种称为低秩适应 (LoRA) 的参数高效微调技术,将通用 LLM (Gemma-3-1b-it) 适配到核领域。通过比较基础模型与微调后模型的神经元激活模式,我们识别出一组神经元,其行为在适应过程中发生了显著变化。为探讨这些特殊神经元的因果作用,我们采用了神经元静音技术。我们的结果表明,尽管对这些特殊神经元逐个静音并未产生统计显著效果,但整体静音这些神经元会导致任务性能的统计显著退化。定性分析进一步表明,静音这些神经元会损害模型生成详细、上下文准确技术信息的能力。本文为增强不透明黑箱模型的透明度提供了具体方法,使领域专长可被追溯到可验证的神经电路。这为实现面向核级人工智能 (AI) 保证提供了路径,解决了由核监管框架 (如 10 CFR 50 Appendix B) 所规定的验证与验证挑战,这些挑战限制了 AI 在安全关键核操作中的部署。

关键词

引用

@article{arxiv.2507.09931,
  title  = {Mechanistic Interpretability of LoRA-Adapted Language Models for Nuclear Reactor Safety Applications},
  author = {Yoon Pyo Lee},
  journal= {arXiv preprint arXiv:2507.09931},
  year   = {2025}
}

备注

Accepted for publication in Nuclear Technology. 24 pages, 2 tables, 4 figures