中文

InfoPO:面向用户导向智能体的信息驱动策略优化

人工智能 2026-03-03 v1

摘要

现实世界中,用户对LLM智能体的请求常常不够明确。智能体必须进行交互以获取缺失信息并做出正确的后续决策。然而,当前基于GRPO的多轮方法常依赖于轨迹级别的奖励计算,这导致信用分配问题以及在 rollout 组内不足够的优势信号。一个可行的方法是识别以粒度识别有价值交互轮次,以驱动更有针对性的学习。为此,我们引入InfoPO(信息驱动策略优化),将多轮交互建模为主动不确定性减少的过程,并计算信息增益奖励,以为反馈可测量改变智能体后续动作分布的轮次提供信用。随后,我们通过自适应方差门控融合将该信号与任务结果结合,以识别信息重要性同时保持任务导向的目标方向。在包括意图澄清、协作编码和工具增强决策等多种任务中,InfoPO 持续地优于提示方法和多轮RL基线。它在用户模拟器转移下也表现出鲁棒性,并能有效泛化到环境交互式任务。总体而言,InfoPO 提供了一种原则且可扩展的机制,用于优化复杂的智能体-用户协作。代码已发布于 https://github.com/kfq20/InfoPO。

关键词

引用

@article{arxiv.2603.00656,
  title  = {InfoPO: Information-Driven Policy Optimization for User-Centric Agents},
  author = {Fanqi Kong and Jiayi Zhang and Mingyi Deng and Chenglin Wu and Yuyu Luo and Bang Liu},
  journal= {arXiv preprint arXiv:2603.00656},
  year   = {2026}
}