中文

AI 与人类判断内容审查:LLM 作为裁判员与伦理基于的拒绝响应

人机交互 2025-05-22 v1 计算与语言

摘要

随着大型语言模型(LLM)在高风险场景中日益部署,其拒绝伦理敏感提示(例如涉及仇恨言论或非法活动)的能力已成为内容审查和负责任 AI 实践的核心。虽然拒绝响应可被视为伦理对齐和注重安全行为的证据,但最近的研究表明,用户可能对此持负面看法。同时,模型输出的自动评估正在发挥越来越大的作用,既在评估中,也在训练中。特别是以一个模型评估另一个模型输出的 LLM 作为裁判框架(LLM-as-a-Judge)——如今已被广泛采用,以指导基准测试和微调。本文检验了此类模型-based 评估器是否对拒绝响应的评估方式不同于人类用户。我们基于 Chatbot Arena 数据及来自两个 AI 裁判员(GPT-4o 和 Llama 3 70B)的判断,对不同类型的拒绝响应进行比较评估。我们区分了伦理拒绝(例如“因可能有害,我无法帮助您”)和技术拒绝(例如“因缺乏实时数据,我无法回答”)。我们发现,LLM 作为裁判的系统在评估伦理拒绝时显著更积极地评价这些行为,而对技术拒绝则未见此类差异。我们将这种差异称为“审查偏差”——即模型-based 评估器相对于人类用户,对拒绝行为给予更高奖励的系统性倾向。这引发了关于透明度、价值对齐以及自动化评估系统中所嵌入规范性假设的更广泛问题。

关键词

引用

@article{arxiv.2505.15365,
  title  = {AI vs. Human Judgment of Content Moderation: LLM-as-a-Judge and Ethics-Based Response Refusals},
  author = {Stefan Pasch},
  journal= {arXiv preprint arXiv:2505.15365},
  year   = {2025}
}