LLM 内容审核与用户满意度:来自 Chatbot Arena 响应拒绝的证据
计算与语言
2025-05-19 v2 人工智能
计算机与社会
人机交互
社会与信息网络
摘要
LLM 的安全性与伦理对齐被广泛讨论,但内容审核对用户满意度的影响仍未被充分探索。特别是,当模型拒绝回答提示时用户作何反应——这是在 LLM 中执行伦理边界的主要机制之一——人们知之甚少。我们通过分析来自 Chatbot Arena 的近 50,000 次模型比较来填补这一空白,该平台允许用户在两两对决中指出其偏好的 LLM 响应,为研究真实世界的用户偏好提供了大规模场景。使用在人工标注数据集上微调的基于 RoBERTa 的新型拒绝分类器,我们区分了因伦理问题导致的拒绝和技术限制导致的拒绝。我们的结果揭示了显著的拒绝惩罚:伦理拒绝的胜率显著低于技术拒绝和标准响应,表明当模型因伦理原因拒绝任务时,用户尤为不满。然而,这种惩罚并非均匀分布。当底层提示高度敏感(例如涉及非法内容)且拒绝措辞详细并与语境相符时,拒绝会获得更有利的评价。这些发现凸显了 LLM 设计中的一个核心矛盾:安全对齐行为可能与用户期望相冲突,需要更具适应性的审核策略以兼顾上下文和呈现方式。
引用
@article{arxiv.2501.03266,
title = {LLM Content Moderation and User Satisfaction: Evidence from Response Refusals in Chatbot Arena},
author = {Stefan Pasch},
journal= {arXiv preprint arXiv:2501.03266},
year = {2025}
}