VORTEX:通过LLM引导的奖励塑形实现任务效用与人类偏好一致
人工智能
2025-09-23 v1
摘要
在社会影响优化中,AI决策系统常依赖于优化已校准数学目标的求解器。然而,这些求解器无法直接容纳不断演变的人类偏好,后者通常以自然语言表达而非形式化约束。最近的研究方法通过使用大语言模型(LLM)从偏好描述生成新的奖励函数来解决此问题。虽然这种方法灵活,但可能牺牲系统核心效用保证。本文提出了\texttt{VORTEX},一种语言引导的奖励塑形框架,在保持既有优化目标稳定的同时,适应性地纳入人类反馈。通过将问题形式化为多目标优化,我们使用LLM基于语言强化和文本梯度提示更新迭代生成塑形奖励。这允许利益相关者通过自然语言引导决策行为,而无需修改求解器或指定权衡权重。我们提供理论保证,表明\texttt{VORTEX}收敛于效用与偏好满足之间的最优Pareto权衡。在真实世界的资源分配任务中,经实证结果表明\texttt{VORTEX}在满足人类对齐覆盖目标方面优于基线方法,同时保持高水平的任务性能。这项工作引入了一种实用且在理论上有据可依的范式,用于由自然语言引导的人类-人工智能协作优化。
引用
@article{arxiv.2509.16399,
title = {VORTEX: Aligning Task Utility and Human Preferences through LLM-Guided Reward Shaping},
author = {Guojun Xiong and Milind Tambe},
journal= {arXiv preprint arXiv:2509.16399},
year = {2025}
}
备注
28pages, 19figures