中文

不可解忏: 评估与改进 LLM 不可解诚实性

机器学习 2026-05-12 v1 人工智能

摘要

大型语言模型(LLM)的不可解旨在移除有害训练数据,同时保持整体效用。然而,我们发现现有方法常出现幻觉、生成异常词序列或行为不一致,引发安全与信任问题。根据 LLM 诚实性相关文献,这类行为常与不诚实相关。这促使我们探讨不可解语境下的诚实性概念。我们提出不可解诚实性的正式定义,包括:(1) 在保留知识方面保持效用与诚实性,(2) 确保有效遗忘,同时鼓励模型承认其局限并对涉及被遗忘知识的问题作出一致回应。为系统评估不可解的诚实性,我们引入一套覆盖效用、保留集合上的诚实性、遗忘效果、问答与选择题情境下拒绝率与拒绝稳定性的指标。评估 9 种方法于 3 大主流家族,显示所有当前方法均未达标。经实验与理论分析后,我们提出 ReVa—a 基于表示对齐的程序,通过微调特征随机化的不可解模型,以更好地承认被遗忘的知识。在来自遗忘集合的问答任务中,ReVa 在两轮交互后实现最高拒绝率, nearly 翻倍于第二名方法的性能。值得注意的是,它还提高了保留集合上的诚实性。我们将发布数据与代码于 https://github.com/renjiegu。

关键词

引用

@article{arxiv.2605.08765,
  title  = {Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning},
  author = {Renjie Gu and Jiazhen Du and Yihua Zhang and Sijia Liu},
  journal= {arXiv preprint arXiv:2605.08765},
  year   = {2026}
}

备注

Accepted by ACL 2026