我们迫切需要内在善良的机器
人工智能
2024-11-08 v1
摘要
人工智能系统正在快速发展,融合了外在动机和内在动机。虽然这些框架提供了好处,但它们在算法层面存在错位的风险,同时表面上似乎与人类价值观一致。在本文中,我们认为内在善良的动机对于确保这些模型与人类价值观内在对齐至关重要。我们认为,善良被定义为一种以最大化他人奖励为动机的利他主义形式,可以抵消任何可能导致模型优先自身而非人类福祉的内在动机。我们的方法引入了一个框架和算法,通过模拟对话将善良嵌入基础模型中。讨论了可扩展实现的局限性和未来研究方向。
引用
@article{arxiv.2411.04126,
title = {We Urgently Need Intrinsically Kind Machines},
author = {Joshua T. S. Hewson},
journal= {arXiv preprint arXiv:2411.04126},
year = {2024}
}
备注
NeurIPS 2024 IMOL Workshop Paper