利用 RAG 实现无训练对齐 LLM
机器学习
2026-05-13 v1 人工智能
密码学与安全
摘要
大语言模型 (LLM) 对齐算法通常由偏好对的后训练组成。虽然这些算法在为安全警戒线和对齐 LLM 以通用人类偏好方面广泛使用,但我们发现最先进的对齐算法需要巨大的计算资源,而且在实现针对近期代理攻击的拒绝警戒线方面能力有限。为改善对此类攻击的拒绝警戒线而不大幅增加计算开销,我们引入基于 RAG 的偏好对齐 (RAG-Pref),一种简单的 RAG 对齐算法,通过在推理时以条件化 preferred 和 dispreferred 样本来利用对比信息。RAG-Pref 在线(无训练),兼容即插即用软件包,当与离线(基于训练)对齐算法结合时,可实现针对五个广泛使用的 LLM 在 agentic 攻击拒绝方面平均提升 3.7 倍,其他在线对齐算法为 2.9,离线对齐单独为 1.5。我们指出,与其他在线对齐方法不同,RAG-Pref 在提升一般人类偏好对齐任务方面同样有效,且不会显著增加总体计算要求。
引用
@article{arxiv.2605.11217,
title = {Leveraging RAG for Training-Free Alignment of LLMs},
author = {John T. Halloran},
journal= {arXiv preprint arXiv:2605.11217},
year = {2026}
}
备注
19 pages, 4 figures, and 6 tables