中文

面向含私有信息的人导人机交互的离线强化学习

机器学习 2022-12-26 v1 机器学习 统计方法学

摘要

受训练聊天机器人以提升客户满意度等人机交互的启发,我们研究涉及私有信息的人导人机交互。我们将该交互建模为一个两人轮流博弈,其中一方(Alice,人)引导另一方(Bob,机器)朝向共同目标。具体地,我们关注该博弈中的离线强化学习(RL),其目标是基于先验收集的离线数据集,找到使期望总奖励最大化的 Alice 和 Bob 的策略对。离线设定带来两个挑战:(i) 我们无法收集 Bob 的私有信息,使用标准 RL 方法时会导致混淆偏差;(ii) 收集数据所用行为策略与待学目标策略之间存在分布失配。为应对混淆偏差,我们将 Bob 的先前动作作为 Alice 当前决策的 instrumental variable(工具变量)以校正未测量的混淆。我们提出了新的辨识结果,并据此给出一种用于评估该两人轮流博弈中策略对的离屏策略评估(OPE)新方法。为应对分布失配,我们利用悲观思想,并使用我们的 OPE 方法开发了一种离屏策略学习算法,以寻找 Alice 和 Bob 均满意的策略对。最后,我们在离线数据部分覆盖等温和假设下证明,通过我们的方法获得的策略对以满意速率收敛到最优策略对。

关键词

引用

@article{arxiv.2212.12167,
  title  = {Offline Reinforcement Learning for Human-Guided Human-Machine Interaction with Private Information},
  author = {Zuyue Fu and Zhengling Qi and Zhuoran Yang and Zhaoran Wang and Lan Wang},
  journal= {arXiv preprint arXiv:2212.12167},
  year   = {2022}
}