中文

从语言层次化奖励设计:增强智能体行为与人类规范的对齐

人工智能 2026-02-24 v1 计算与语言 人机交互 机器学习

摘要

在训练人工智能(AI)执行任务时,人类往往关心的不仅是任务是否完成,更关心任务的完成方式。随着AI代理 Tackling 日益复杂的任务,将其行为与人类提供的规范对齐变得至关重要,以实现负责任的AI部署。奖励设计提供了一种直接将这种对齐通过将人类期望转化为引导强化学习(RL)的奖励函数。然而,现有方法往往无法捕捉在长期任务中出现的细腻人类偏好。因此,我们提出层次化奖励设计从语言(HRDL):一种扩展经典奖励设计以编码更丰富行为规范的层次化RL代理的Problem Formulation。我们进一步提出语言到层次化奖励(L2HR)作为HRDL的解决方案。实验表明,使用L2HR设计的奖励训练的AI代理不仅有效完成任务,而且更符合人类规范。HRDL和L2HR共同推动了人类对齐AI代理的研究。

关键词

引用

@article{arxiv.2602.18582,
  title  = {Hierarchical Reward Design from Language: Enhancing Alignment of Agent Behavior with Human Specifications},
  author = {Zhiqin Qian and Ryan Diaz and Sangwon Seo and Vaibhav Unhelkar},
  journal= {arXiv preprint arXiv:2602.18582},
  year   = {2026}
}

备注

Extended version of an identically-titled paper accepted at AAMAS 2026