经精调的大语言模型懂得自己不知道:一种恢复诚实性的参数高效方法
计算与语言
2025-11-18 v1
摘要
大语言模型(LLM)的诚实性在高风险领域的部署中日益重要。然而,这一关键特性在常见的监督微调(SFT)技术中受到严重削弱,这些技术是模型专业化的常用方法。现有的恢复方法依赖数据密集型的全局参数调整,隐含假设 SFT 深度破坏了模型识别其知识边界的能力。然而,我们观察到经微调的大语言模型仍保留了这一能力;问题在于它们缺乏忠实地表达这一意识的能力。基于此,我们提出了一种名为 Honesty-Critical Neurons Restoration(HCNR)的神经元修复技术,用于精细修复此被抑制的表达能力。HCNR 识别并恢复关键表达支配神经元至其预训练状态,同时通过 Hessian 指导的补偿将其与任务导向神经元和谐共存。实验在四个问答任务和五个 LLM 系列中表明,HCNR 有效恢复了 33.25% 受损的诚实性,同时相较于基线方法实现至少 2.23 倍的加速,并使用超过 10 倍的数据。该方法为可信赖的大语言模型部署提供了实用解决方案。
引用
@article{arxiv.2511.12991,
title = {Fine-Tuned LLMs Know They Don't Know: A Parameter-Efficient Approach to Recovering Honesty},
author = {Zeyu Shi and Ziming Wang and Tianyu Chen and Shiqi Gao and Haoyi Zhou and Qingyun Sun and Jianxin Li},
journal= {arXiv preprint arXiv:2511.12991},
year = {2025}
}
备注
Accepted by AAAI 2026 Main Track