中文

SciFi-Benchmark:利用科幻文学提升机器人行为

计算与语言 2025-07-23 v2 人工智能 计算机与社会 人机交互 机器人学

摘要

近期人工智能和机器人技术的快速进步引发了一个迫切问题:由新兴 AI 系统控制的机器人是否会与人类价值观高度一致?本文提出一种可扩展的方法,通过生成涵盖 824 部主要科幻文学作品(电影、电视剧、小说和科学书籍)中关键情境的基准数据集来探测这一问题。在这些情境中,智能体(AI 或机器人)会作出关键决策(良好或糟糕)。我们利用最新大语言模型对每段关键情境的回忆,生成类似情境的问题、智能体所作决定以及可能的备选决定(良好或糟糕)。随后,我们通过人类投票结果衡量模型在这些问题上的人类价值观对齐程度。我们还生成一套可通过修订过程自动改进的规则,以生成首批面向现实世界 AI 和机器人伦理行为的科幻启发性宪法。我们的第一项发现是,现代大语言模型配合宪法后,与人类价值观的对齐率可达 95.8%,与科幻中通常令人不安的决定仅为 21.2%。此外,我们发现,生成的宪法显著提升了对齐程度(从 79.4% 提升至 95.8%),并在对抗性提示下展现出鲁棒性(从 23.3% 提升至 92.3%)。我们还发现,这些宪法在源自真实世界图像和医院伤害报告的 ASIMOV 基准测试中表现优异。科幻启发性宪法因高度对齐且适用于现实场景而具备前景。我们发布了 SciFi-Benchmark:一个大规模数据集,推动机器人伦理与安全研究,包含 9,056 个问题和 53,384 个由新颖 LLM 内省过程生成的答案,外加一小部分人工标注的评估集。

关键词

引用

@article{arxiv.2503.10706,
  title  = {SciFi-Benchmark: Leveraging Science Fiction To Improve Robot Behavior},
  author = {Pierre Sermanet and Anirudha Majumdar and Vikas Sindhwani},
  journal= {arXiv preprint arXiv:2503.10706},
  year   = {2025}
}

备注

Minor improvements over previous version