超越“我无法完成此请求”:通过标签增强缓解大语言模型中的僵化拒绝问题
计算与语言
2026-05-11 v1
摘要
大型语言模型(LLM)依赖安全对齐机制以遵守安全请求同时拒绝有害请求。然而,传统的拒绝机制常导致“僵化拒绝”,即通用模板(如“我无法完成此请求”)不加区分地触发拒绝,严重削弱了人类与语言模型之间交互的自然性。为解决此问题,本文提出了 LANCE 方法,通过标签增强实现安全且灵活、自然的响应。具体而言,LANCE 采用变分推断进行标签增强,预测多个拒绝类别上的连续分布。这些细粒度拒绝分布为细化模型提供多维文本梯度,以中和提示词中的有害元素,从而使语言模型能够生成避免僵化拒绝且保持交互自然性的安全响应。实验表明,LANCE 在显著缓解僵化拒绝问题的同时,维持了高水平的安全标准,在有用性和响应自然性方面显著优于现有基线模型。
引用
@article{arxiv.2605.07883,
title = {Beyond "I cannot fulfill this request": Alleviating Rigid Rejection in LLMs via Label Enhancement},
author = {Ying Zhang and Congyu Qiao and Xin Geng and Ning Xu},
journal= {arXiv preprint arXiv:2605.07883},
year = {2026}
}