中文

向有德性的强化学习:批评与路线图

人工智能 2026-04-08 v2

摘要

本文批判了强化学习(RL)中常见的伦理方法模式,提出以德性为导向的替代方案。我们指出当前文献中存在两类常见局限:(i) 基于规则的(义务论)方法将职责编码为约束或护盾,常在模糊性和非平稳性下难以应对,且不培育持久的习惯;(ii) 许多基于奖励的方法,尤其是单目标RL,隐式地将多样的道德考量压缩为单个标量信号,这在实践中可能掩盖权衡并诱发代理游戏。我们则将伦理视为政策层面的 disposition,即在激励、合作伙伴或情境变化时仍能保持稳定的习惯。这是将评估从规则检查或标量回报转向特征概述、干预下的耐久性,以及对伦理权衡的明确报告。我们的路线图由四个组件组成:(1) 多智能体RL中的社会学习,以规范性信息的 imperfect 但有约束力的典范获取德性类似模式;(2) 多目标和受限建模,保留价值冲突并纳入风险敏感准则以防伤害;(3) 基于亲和力的正则化,以可更新的德性先验支持特征级稳定性,同时允许规范演化;(4) 将多样化的伦理传统操作化为实际控制信号,明确价值和文化假设塑造伦理RL基准。

关键词

引用

@article{arxiv.2512.04246,
  title  = {Toward Virtuous Reinforcement Learning: A Critique and Roadmap},
  author = {Majid Ghasemi and Mark Crowley},
  journal= {arXiv preprint arXiv:2512.04246},
  year   = {2026}
}

备注

Accepted as a workshop paper at Machine Ethics: From Formal Methods to Emergent Machine Ethics workshop at the AAAI 2026 Conference