SafeConstellations:通过任务感知表示引导消除大语言模型中的过度拒绝
计算与语言
2026-04-21 v4
摘要
大语言模型日益表现出过度拒绝行为,即安全机制导致模型拒绝看似类似有害内容的善意指令。这种现象会削弱依赖常见提示模板或频繁依赖大语言模型完成特定任务(如情感分析、语言翻译)的生产应用的实用性。通过广泛评估,我们证明了大语言模型在输入包含有害内容时仍会拒绝,即使这些内容被重新表述为善意意图的任务。我们的机制性分析揭示,大语言模型在嵌入空间中沿着不同层的表示路径遵循独特的“星座”模式,每个自然语言处理任务都保持一致的轨迹,在拒绝和非拒绝案例之间发生可预测的位移。我们提出了SafeConstellations,这是一种基于推理时间轨迹位移的方法,通过跟踪任务特定的轨迹模式并引导表示走向非拒绝路径。通过仅针对易发生过度拒绝的任务选择性地引导模型行为,我们的方法在最小化实用性影响的同时消除过度拒绝,提供了一种原则且有条件的消除过度拒绝方法。
引用
@article{arxiv.2508.11290,
title = {SafeConstellations: Mitigating Over-Refusals in LLMs Through Task-Aware Representation Steering},
author = {Utsav Maskey and Sumit Yadav and Mark Dras and Usman Naseem},
journal= {arXiv preprint arXiv:2508.11290},
year = {2026}
}
备注
ACL 2026 Main