委婉拒绝!LLM护栏对用户感知与偏好的情境效应
计算与语言
2025-12-04 v2 人工智能
人机交互
摘要
当前的LLM被训练为拒绝潜在有害的输入查询,无论用户是否确实具有有害意图,这导致了安全性与用户体验之间的权衡。通过对480名参与者评估3,840个查询-响应对的研究,我们考察了不同的拒绝策略如何影响不同动机下的用户感知。我们的发现表明,响应策略在很大程度上塑造了用户体验,而实际的用户动机影响微乎其微。部分合规——在不提供可操作细节的情况下提供一般信息——成为最优策略,与直接拒绝相比,将负面用户感知降低了50%以上。作为补充,我们分析了9个SOTA LLM的响应模式,并评估了6个奖励模型如何对不同拒绝策略进行评分,表明模型很少自然地部署部分合规,且奖励模型目前低估了它。这项工作表明,有效的护栏需要专注于精心设计拒绝方式而非检测意图,为实现既确保安全又维持用户持续参与的AI安全机制提供了一条路径。
引用
@article{arxiv.2506.00195,
title = {Let Them Down Easy! Contextual Effects of LLM Guardrails on User Perceptions and Preferences},
author = {Mingqian Zheng and Wenjia Hu and Patrick Zhao and Motahhare Eslami and Jena D. Hwang and Faeze Brahman and Carolyn Rose and Maarten Sap},
journal= {arXiv preprint arXiv:2506.00195},
year = {2025}
}
备注
Accepted to Findings of EMNLP 2025