误差情报:众包收集 AI 代理异常行为
人工智能
2025-11-06 v2
摘要
高级 AI 系统有时会以与人类意图不同的方式行动。为收集清晰、可复现的示例,我们举办了“误差情报”计划:一个众包项目,收集代理 pursuit 不恰当或不安全目标的案例。该情报计划收到了 295 个投稿,其中九个获得奖励。本报告解释了项目的动机与评估标准,并逐步详解这九个获奖作品。
引用
@article{arxiv.2510.19738,
title = {Misalignment Bounty: Crowdsourcing AI Agent Misbehavior},
author = {Rustem Turtayev and Natalia Fedorova and Oleg Serikov and Sergey Koldyba and Lev Avagyan and Dmitrii Volkov},
journal= {arXiv preprint arXiv:2510.19738},
year = {2025}
}
备注
Add Limitations section