中文

委婉拒绝!LLM护栏对用户感知与偏好的情境效应

计算与语言 2025-12-04 v2 人工智能 人机交互

摘要

当前的LLM被训练为拒绝潜在有害的输入查询,无论用户是否确实具有有害意图,这导致了安全性与用户体验之间的权衡。通过对480名参与者评估3,840个查询-响应对的研究,我们考察了不同的拒绝策略如何影响不同动机下的用户感知。我们的发现表明,响应策略在很大程度上塑造了用户体验,而实际的用户动机影响微乎其微。部分合规——在不提供可操作细节的情况下提供一般信息——成为最优策略,与直接拒绝相比,将负面用户感知降低了50%以上。作为补充,我们分析了9个SOTA LLM的响应模式,并评估了6个奖励模型如何对不同拒绝策略进行评分,表明模型很少自然地部署部分合规,且奖励模型目前低估了它。这项工作表明,有效的护栏需要专注于精心设计拒绝方式而非检测意图,为实现既确保安全又维持用户持续参与的AI安全机制提供了一条路径。

关键词

引用

@article{arxiv.2506.00195,
  title  = {Let Them Down Easy! Contextual Effects of LLM Guardrails on User Perceptions and Preferences},
  author = {Mingqian Zheng and Wenjia Hu and Patrick Zhao and Motahhare Eslami and Jena D. Hwang and Faeze Brahman and Carolyn Rose and Maarten Sap},
  journal= {arXiv preprint arXiv:2506.00195},
  year   = {2025}
}

备注

Accepted to Findings of EMNLP 2025