中文

DarkBench:大型语言模型中黑暗模式的基准测试

计算与语言 2025-03-17 v1 人工智能 计算机与社会

摘要

我们提出DarkBench,一个用于检测大型语言模型(LLM)交互中黑暗设计模式的综合性基准测试。黑暗设计模式是一类操纵用户行为的技巧。我们的基准测试包括660个提示,涵盖六个类别:品牌偏见、用户保留、从众性、拟人化、有害生成和暗中操作。我们评估了来自五家领先公司(OpenAI、Anthropic、Meta、Mistral、Google)的模型,发现一些LLM被设计为偏向其开发者的产品,表现出不诚实的沟通等其他操纵性行为。开发LLM的公司应意识到并减轻黑暗设计模式的影响,以促进更伦理的AI。

关键词

引用

@article{arxiv.2503.10728,
  title  = {DarkBench: Benchmarking Dark Patterns in Large Language Models},
  author = {Esben Kran and Hieu Minh "Jord" Nguyen and Akash Kundu and Sami Jawhar and Jinsuk Park and Mateusz Maria Jurewicz},
  journal= {arXiv preprint arXiv:2503.10728},
  year   = {2025}
}

备注

Accepted as an Oral paper at ICLR 2025