ARREST:针对大语言模型事实性与安全性的对抗鲁棒性调控框架
计算与语言
2026-01-09 v1
摘要
人类认知由复杂的神经化学过程驱动,在想象与现实之间振荡,并学习在这种细微偏差导致幻觉或不安全关联时进行自我纠正。近年来,大语言模型在广泛任务中展现出惊人的性能,但仍缺乏人类认知所具备的在事实性与安全性之间进行平衡的能力。鉴于这种相似性,我们认为大语言模型中的事实性和安全性失败源于其潜在激活空间中的表示错位,而非将其视为完全独立的对齐问题。我们假设外部网络可被训练以理解这些波动,对模型进行有选择性干预,以在不调整模型参数本身情况下,将错误纠正为事实性,并将不安全输出转化为安全输出。基于此假设,我们提出了ARREST (Adversarial Resilient Regulation Enhancing Safety and Truth),一个统一框架,用于识别和纠正漂移特征,同时包含软拒绝与硬拒绝以及事实性纠正。我们的实验结果表明,ARREST不仅调节了错位现象,而且在生成软拒绝方面相较于RLHF对齐模型更具灵活性。我们在https://github.com/sharanya-dasgupta001/ARREST公开代码库。
引用
@article{arxiv.2601.04394,
title = {ARREST: Adversarial Resilient Regulation Enhancing Safety and Truth in Large Language Models},
author = {Sharanya Dasgupta and Arkaprabha Basu and Sujoy Nath and Swagatam Das},
journal= {arXiv preprint arXiv:2601.04394},
year = {2026}
}