中文

稀疏实体感知调优:在保持认知退却能力的知识适应

人工智能 2026-04-22 v3

摘要

在大规模LLM适应新知识时,标准微调往往会削弱aligned epistemic abstention的能力,即模型在不确定时承认自身不知的能力。这种失效模式在高风险场景中尤为棘手,因为退却是防止幻觉的关键安全措施。我们提出了SEAT(Sparse Entity-Aware Tuning for Knowledge Adaptation while Preserving Epistemic Abstention),一种保持认知退却能力的预防性微调方法,同时实现强大的知识获取。SEAT结合稀疏调优(限制全局激活漂移)和实体扰动KL正则化(锐化局部认知边界,防止知识溢出至相邻知识)。关键的是,SEAT无需对齐数据、显式边界探针或事后重新对齐,因而非常适用于轻量级且隐私敏感的适应。跨模型和数据集,SEAT在未知查询上的人类评估退却提升了18%-101%,同时保持近乎完美的目标知识获取,产生调和、上下文感知的退却。进一步分析表明,两个组件都至关重要,SEAT在表示空间中更干净地分离已知与未知查询,同时保持下游实用性。这些结果将认知退却的保存 identified as 知识适应的核心目标。

关键词

引用

@article{arxiv.2506.14387,
  title  = {SEAT: Sparse Entity-Aware Tuning for Knowledge Adaptation while Preserving Epistemic Abstention},
  author = {William F. Shen and Xinchi Qiu and Nicola Cancedda and Nicholas D. Lane},
  journal= {arXiv preprint arXiv:2506.14387},
  year   = {2026}
}