中文

LLM 内容审核与用户满意度:来自 Chatbot Arena 响应拒绝的证据

计算与语言 2025-05-19 v2 人工智能 计算机与社会 人机交互 社会与信息网络

摘要

LLM 的安全性与伦理对齐被广泛讨论,但内容审核对用户满意度的影响仍未被充分探索。特别是,当模型拒绝回答提示时用户作何反应——这是在 LLM 中执行伦理边界的主要机制之一——人们知之甚少。我们通过分析来自 Chatbot Arena 的近 50,000 次模型比较来填补这一空白,该平台允许用户在两两对决中指出其偏好的 LLM 响应,为研究真实世界的用户偏好提供了大规模场景。使用在人工标注数据集上微调的基于 RoBERTa 的新型拒绝分类器,我们区分了因伦理问题导致的拒绝和技术限制导致的拒绝。我们的结果揭示了显著的拒绝惩罚:伦理拒绝的胜率显著低于技术拒绝和标准响应,表明当模型因伦理原因拒绝任务时,用户尤为不满。然而,这种惩罚并非均匀分布。当底层提示高度敏感(例如涉及非法内容)且拒绝措辞详细并与语境相符时,拒绝会获得更有利的评价。这些发现凸显了 LLM 设计中的一个核心矛盾:安全对齐行为可能与用户期望相冲突,需要更具适应性的审核策略以兼顾上下文和呈现方式。

关键词

引用

@article{arxiv.2501.03266,
  title  = {LLM Content Moderation and User Satisfaction: Evidence from Response Refusals in Chatbot Arena},
  author = {Stefan Pasch},
  journal= {arXiv preprint arXiv:2501.03266},
  year   = {2025}
}