稀疏实体感知调优:在保持认知退却能力的知识适应
人工智能
2026-04-22 v3
摘要
在大规模LLM适应新知识时,标准微调往往会削弱aligned epistemic abstention的能力,即模型在不确定时承认自身不知的能力。这种失效模式在高风险场景中尤为棘手,因为退却是防止幻觉的关键安全措施。我们提出了SEAT(Sparse Entity-Aware Tuning for Knowledge Adaptation while Preserving Epistemic Abstention),一种保持认知退却能力的预防性微调方法,同时实现强大的知识获取。SEAT结合稀疏调优(限制全局激活漂移)和实体扰动KL正则化(锐化局部认知边界,防止知识溢出至相邻知识)。关键的是,SEAT无需对齐数据、显式边界探针或事后重新对齐,因而非常适用于轻量级且隐私敏感的适应。跨模型和数据集,SEAT在未知查询上的人类评估退却提升了18%-101%,同时保持近乎完美的目标知识获取,产生调和、上下文感知的退却。进一步分析表明,两个组件都至关重要,SEAT在表示空间中更干净地分离已知与未知查询,同时保持下游实用性。这些结果将认知退却的保存 identified as 知识适应的核心目标。
引用
@article{arxiv.2506.14387,
title = {SEAT: Sparse Entity-Aware Tuning for Knowledge Adaptation while Preserving Epistemic Abstention},
author = {William F. Shen and Xinchi Qiu and Nicola Cancedda and Nicholas D. Lane},
journal= {arXiv preprint arXiv:2506.14387},
year = {2026}
}