通过考虑自我想象与心智理论实现对阿尔法利斯人类价值的自主对齐
人工智能
2025-01-08 v2
摘要
随着人工智能 (AI) 在人类社会中的广泛应用,使 AI 能够自主对齐人类价值已成为确保其可持续发展并惠及人类的迫切问题。与人类价值对齐的最重要方面之一是代理人需要自主作出利他、安全且伦理的决策,这些决策考虑并关心人类的福祉。当前的 AI 极力追求在某些任务中绝对优势,对周围环境和其他代理人漠不关心,这导致诸多安全风险。利他行为在人类社会中源于人类对他人共情的能力,称为心智理论 (Theory of Mind, ToM),并通过在采取行动前进行预测性想象交互来产生体贴和利他行为。受此启发,我们致力于赋予代理人考虑他人和心智理论能力,使其能够通过隐式的内在动机自主对齐人类的利他价值。通过将 ToM 融入想象空间,代理人能够实时关注其他代理人的福祉,主动预见对自身和他人可能产生的风险,并作出在平衡对环境负面影响方面进行考虑的利他决策。古代中国故事《司马光劈瓮》描绘了年轻的司马光为了救一名意外坠入瓮中的孩子而砸碎瓮子的道德行为,这是本篇论文的优秀参考情景。我们设计了一个类似《司马光劈瓮》及其变体的实验场景,这些情景反映了在自身目标、利他救援以及避免负面副作用之间进行权衡和全面考虑的情形。
引用
@article{arxiv.2501.00320,
title = {Autonomous Alignment with Human Value on Altruism through Considerate Self-imagination and Theory of Mind},
author = {Haibo Tong and Enmeng Lu and Yinqian Sun and Zhengqiang Han and Chao Liu and Feifei Zhao and Yi Zeng},
journal= {arXiv preprint arXiv:2501.00320},
year = {2025}
}