中文

HAVA:基于奖励加权的强化学习价值对齐混合方法

人工智能 2025-05-22 v1

摘要

社会由一套规范构成,这些规范共同塑造我们所珍视的价值,如安全、公平或可信赖性。价值对齐的目标是创建既能完成任务又能通过其行为促进这些价值的智能体。许多规范以法律或规则形式书面化(法律/安全规范),而另一类规范则未被书面化(社会规范)。此外,用于表示这些规范的技术也不同。安全/法律规范常以逻辑语言等显式方式表示,而社会规范通常通过学习获得并潜伏于神经网络参数空间中。文献中缺乏能够将这些各种规范表示整合到单一算法中的方法。我们提出了一种新方法,将这些规范整合到强化学习过程中。该方法监控智能体对给定规范的合规性,并将其总结为我们称为声誉的数量。该数量用于加权所获奖励,以激励智能体实现价值对齐。我们进行了一系列实验,包括连续状态空间的交通问题,以展示书面规范和非书面规范的重要性,并展示了本方法如何找到价值对齐的政策。此外,我们进行了消融实验,以说明将这两类规范组合优于仅使用其中一种。

关键词

引用

@article{arxiv.2505.15011,
  title  = {HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning},
  author = {Kryspin Varys and Federico Cerutti and Adam Sobey and Timothy J. Norman},
  journal= {arXiv preprint arXiv:2505.15011},
  year   = {2025}
}