中文

基于偏好型多目标强化学习的社会价值体系学习

人工智能 2026-02-12 v2 计算机与社会 机器学习

摘要

价值感知AI应识别人类价值并适应不同用户的价值体系(基于价值的偏好)。这需要对价值进行操作化,而这可能导致误指定。价值的社会性质要求其表示遵循多个用户,同时价值体系具有多样性,却在群体之间呈现模式。在顺序决策中,已有工作致力于针对来自不同代理人演示的不同目标或价值的个性化。然而,这些方法需要手动设计特征,或缺乏基于价值的可解释性和/或对多样化用户偏好的适应性。我们提出了用于Markov决策过程(MDPs)中社会代理人价值对齐和价值体系学习的算法,基于聚类和偏好型多目标强化学习(PbMORL)。我们联合学习社会派生的价值对齐模型( grounding )以及一组代表其成员价值偏好的价值体系。每个群簇包含代表其成员基于价值的偏好的价值体系以及反映该价值体系所对齐行为的近似Pareto最优政策。我们在两个具有人类价值的MDPs上对我们的方法进行了评估,与最先进的PbMORL算法和基线方法进行了比较。

关键词

引用

@article{arxiv.2602.08835,
  title  = {Learning the Value Systems of Societies with Preference-based Multi-objective Reinforcement Learning},
  author = {Andrés Holgado-Sánchez and Peter Vamplew and Richard Dazeley and Sascha Ossowski and Holger Billhardt},
  journal= {arXiv preprint arXiv:2602.08835},
  year   = {2026}
}

备注

18 pages, 3 figures. To be published in proceedings of the 25th International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS 2026). This is a full version that includes the supplementary material