中文

CARE:通过回滚与内省干预实现解码时安全对齐

机器学习 2025-09-10 v1 人工智能 计算与语言

摘要

随着大型语言模型(LLM)越来越多地部署于实际应用中,确保其在解码过程中的输出安全性已成为一项关键挑战。然而,现有的解码时干预方法(如对比解码)往往在安全性和响应质量之间造成严重的权衡。在本研究中,我们提出了 CARE,一个用于解码时安全对齐的新颖框架,它集成了三个关键组件:(1) 用于实时安全监控的守卫模型,能够检测潜在的不安全内容;(2) 带有 token 缓冲区的回滚机制,可在较早阶段高效纠正不安全输出,而不会破坏用户体验;(3) 一种新颖的基于内省的干预策略,模型对其先前的输出生成自我反思批评,并将这些反思纳入上下文以指导后续的解码步骤。该框架通过使用其守卫模型进行精确干预、回滚机制进行及时纠正以及新颖的内省方法进行有效自我纠正,实现了卓越的安全性与质量权衡。实验结果表明,我们的框架在安全性、质量和效率之间取得了卓越的平衡,在保持高响应质量的同时,实现了低有害响应率和对用户体验的最小干扰。

关键词

引用

@article{arxiv.2509.06982,
  title  = {CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention},
  author = {Xiaomeng Hu and Fei Huang and Chenhan Yuan and Junyang Lin and Tsung-Yi Ho},
  journal= {arXiv preprint arXiv:2509.06982},
  year   = {2025}
}