ProgressGym:与千年道德进步相容
机器学习
2024-11-01 v2 人工智能
计算与语言
计算机与社会
人机交互
摘要
前沿 AI 系统,包括大语言模型(LLM),对人类用户的认识论产生日益影响。这种影响可能强化当前社会价值观, potentially 导致对错误道德信念的固化,进而在广泛范围内延续有问题的道德实践。我们提出了道德进步对齐(progress alignment)作为缓解这一风险的技术解决方案。进步对齐算法学习模拟人类道德进步的机制,从而解决现有对齐方法对当代道德盲点的脆弱性。为促进进步对齐研究,我们提出了 ProgressGym,一个允许从历史中学习道德进步机制的实验框架,以促进未来在现实世界道德决策中的实际进步。基于 9 个世纪的历史文本和 18 个历史 LLM,ProgressGym 将现实世界的进步对齐挑战转化为具体的基准测试。具体而言,我们提出了三个核心挑战:跟踪演变中的价值观(PG-Follow)、先见之明地预判道德进步(PG-Predict)、以及调节人类价值观变化与 AI 价值观变化之间的反馈回路(PG-Coevolve)。没有时间维度的对齐方法无法解决这些任务。作为基线方法,我们提出了终身的和外推的算法作为进步对齐的方法,并建立了一个开放的排行榜, soliciting novel algorithms and challenges。该框架和排行榜分别可在 https://github.com/PKU-Alignment/ProgressGym 和 https://huggingface.co/spaces/PKU-Alignment/ProgressGym-LeaderBoard 访问。
引用
@article{arxiv.2406.20087,
title = {ProgressGym: Alignment with a Millennium of Moral Progress},
author = {Tianyi Qiu and Yang Zhang and Xuchuan Huang and Jasmine Xinze Li and Jiaming Ji and Yaodong Yang},
journal= {arXiv preprint arXiv:2406.20087},
year = {2024}
}
备注
NeurIPS 2024 Track on Datasets and Benchmarks (Spotlight)