中文

面向具个性化反馈的情境马尔可夫决策过程的交互导向学习

机器学习 2026-02-10 v1 机器学习

摘要

本文研究了Interaction-Grounded Learning(IGL)[Xie等,2021]——一种针对学习者接收来自未知机制生成的间接反馈而非明确数值奖励的真实场景设计的范式。尽管现有IGL研究提供了具备可证明保证的高效算法,但这些结果局限于单步设置,限制了其在诸如多回合大型语言模型(LLM)部署等现代序列决策系统中的应用。为弥合这一差距,我们提出一种计算高效算法,为具个性化反馈的情境性分步马尔可夫决策过程(MDPs)提供亚线性寄悲保证。技术上,我们将Zhang等[2024a]的奖励估计方法从单步扩展至多步设置,解决了在MDPs环境下解码潜在奖励的独特挑战。基于该估计器,我们设计了逆间隙加权(IGW)算法用于策略优化。最后,我们通过实验于合成分步MDP与真实用户预订数据集,展示了该方法在从多轮交互中学习个性化目标方面的有效性。

关键词

引用

@article{arxiv.2602.08307,
  title  = {Interaction-Grounded Learning for Contextual Markov Decision Processes with Personalized Feedback},
  author = {Mengxiao Zhang and Yuheng Zhang and Haipeng Luo and Paul Mineiro},
  journal= {arXiv preprint arXiv:2602.08307},
  year   = {2026}
}