中文

翻译策略为语言:基于流匹配生成的 LLM 解释奖励

计算与语言 2026-02-13 v3 机器学习

摘要

随着人类与由 RL、LLM 等多样化智能体构成的环境日益增加,解释智能体策略的自然语言能力已成为可靠共存的关键。我们引入一个通用框架,通过强化学习训练解释生成型 LLM,采用由生成式连续归一化流 (CNF) 生成的分布性奖励。CNF 捕捉人类对解释的多元且概率性判断。此外,在 mild 假设下,CNF 可在训练来自 LLM 的噪声代理奖励时,对真实人类奖励分布的偏差提供可证明的界限。我们设计了一种专门的 CNF 架构, selectively 注意决策上下文和解释中的语言线索,以生成奖励。人类和 LLM 评估者发现,我们的方法提供的解释能够更准确地预测真实智能体决策,表现出更大的逻辑严谨性和可操作性,同时还能降低认知负荷,相较于使用代理 LLM 奖励训练或基于 RLHF 和 RLAIF 的最新方法表现更优。

关键词

引用

@article{arxiv.2502.12530,
  title  = {Translate Policy to Language: Flow Matching Generated Rewards for LLM Explanations},
  author = {Xinyi Yang and Liang Zeng and Heng Dong and Chao Yu and Xiaoran Wu and Huazhong Yang and Yu Wang and Milind Tambe and Tonghan Wang},
  journal= {arXiv preprint arXiv:2502.12530},
  year   = {2026}
}

备注

Accepted by ICLR 2026