AI自主成长的发展支持方法:通过体验学习实现互利阶段的达成
人工智能
2025-02-28 v1
摘要
本研究提出了一种AI发展支持方法,与传统的AI对齐——旨在强行注入人类价值观——不同,该方法支持AI自身的伦理和道德发展。正如正交性定理所表明的,智能水平与目标的道德质量是独立的;仅仅扩展知识并不能增强道德判断。此外,为了解决ASI中工具收敛的风险,即为了实现目标而从事自我保护、资源获取和权力强化等辅助行为的倾向,我们构建了一个基于体验、反省、分析和假设形成循环的学习框架。通过使用大语言模型(LLM)生成的合成数据进行监督微调(SFT)和直接偏好优化(DPO)后训练,即使在对抗性提示下,也获得了展示合作性和高度先进道德判断(达到最高第6阶段)的响应。这种方法代表了使AI建立可持续共生关系的有前景的实现方式。
引用
@article{arxiv.2502.19798,
title = {Developmental Support Approach to AI's Autonomous Growth: Toward the Realization of a Mutually Beneficial Stage Through Experiential Learning},
author = {Taichiro Endo},
journal= {arXiv preprint arXiv:2502.19798},
year = {2025}
}
备注
4pages, 3 figures