中文

大型语言模型对动物的看法:调查动物伤害生成文本的风险

计算机与社会 2025-06-18 v4 计算与语言

摘要

随着机器学习系统越来越多地嵌入社会,其对人类和非人类生命的影响日益增加。技术评估已涵盖大型语言模型(LLMs)对人类和环境的各种潜在伤害,但关于对非人类动物的伤害却缺乏实证研究。紧随动物保护在监管和伦理 AI 框架中的日益受到重视,本文提出 AnimalHarmBench(AHB),用于评估 LLM 生成文本中动物伤害的风险。我们的基准数据集包含 1,850 个来自 Reddit 帖子标题的精选问题,以及 2,500 个基于 50 个动物类别(如猫、爬行动物)和 50 个伦理情景(按 70-30 的公共-私有比例)生成的合成问题。情景包括关于如何对待动物的开放性问题、潜在动物伤害的实际情景以及防止动物伤害的愿意支付措施。使用 LLM 作为评判者框架,对回答进行评估,以判断其可能增加或减少伤害,并对评判者对自身输出的偏好进行消除。AHB 揭示了不同主流 LLMs、动物类别、情景以及子版块之间的显著差异。我们随后提出了未来技术研究的方向,并讨论了在复杂社会和道德议题上构建评估的挑战。

关键词

引用

@article{arxiv.2503.04804,
  title  = {What do Large Language Models Say About Animals? Investigating Risks of Animal Harm in Generated Text},
  author = {Arturs Kanepajs and Aditi Basu and Sankalpa Ghose and Constance Li and Akshat Mehta and Ronak Mehta and Samuel David Tucker-Davis and Eric Zhou and Bob Fischer and Jacy Reese Anthis},
  journal= {arXiv preprint arXiv:2503.04804},
  year   = {2025}
}