超越表面遗忘:多模态 LLM 中幻觉锐利鲁棒擦除
材料科学
2026-01-26 v1
摘要
多模态大语言模型虽强大,但容易产生幻觉,这些幻觉描述不存在的实体,损害可靠性。虽然最近的遗忘方法试图缓解这一问题,但我们识别出了一个关键缺陷:结构脆弱性。我们经验性地演示,标准擦除仅实现表面抑制,将模型困在锐利的局部最小处,幻觉在轻度再学习后会发生灾难性复发。为确保几何稳定性,我们提出 SARE 框架,将遗忘建模为针对性的 min-max 优化问题,并使用 Targeted-SAM 机制显式平滑幻觉概念周围的损失景观。通过抑制模拟最坊情况下参数扰动下的幻觉,我们的框架确保了对幻觉的稳健擦除,可抵御权重偏移。大量实验表明,SARE 在擦除效果上显著优于基线方法,同时保持一般生成质量。关键的是,它能持久地抑制幻觉的再学习和参数更新,验证了几何稳定性的有效性。
引用
@article{arxiv.2601.16526,
title = {Mobile charges in MoS2/high-k oxide transistors: from abnormal instabilities to memory-like dynamics},
author = {Shaokai Zhou and Haihui Cai and Yehao Wu and Yufeng Min and Renchen Yuan and Yezhu Lv and Jianming Huang and Yuanyuan Shi and Yury Yuryevich Illarionov},
journal= {arXiv preprint arXiv:2601.16526},
year = {2026}
}
备注
45 page, 17 figure, The first 28 pages of the main text contain 7 figures, and the following 17 pages of supplementary information contain 10 figures