中文

价值内化:从社会奖励学习与泛化

机器学习 2024-07-23 v1 人工智能 多智能体系统

摘要

社会奖励塑造人类行为。在发展过程中,照顾者引导学习者的行为朝向与文化一致的目标和价值观。当照顾者不在时,行为如何持续并泛化?我们提出一种价值内化模型,其中社会反馈训练内部社会奖励(ISR)模型,当社会奖励不可用时,ISR模型生成内部奖励。通过经验仿真,我们展示ISR模型可防止代理人遗忘社会化行为,并在分布外任务中实现泛化。我们描述了不完全内化的含义,这类似于\'奖励黑客\'对ISR的影响。此外,我们展示了该模型在多代理环境中内化利他行为。我们的工作为理解人类如何获取和泛化价值提供了基础,为与人类价值观一致性AI提供了见解。

关键词

引用

@article{arxiv.2407.14681,
  title  = {Value Internalization: Learning and Generalizing from Social Reward},
  author = {Frieda Rong and Max Kleiman-Weiner},
  journal= {arXiv preprint arXiv:2407.14681},
  year   = {2024}
}

备注

Reinforcement Learning Conference (RLC) 2024 & Cognitive Science Conference Oral