中文

基于情境组合型多臂老虎机的谈判方法

人工智能 2024-07-02 v1 机器学习

摘要

学习有效的谈判策略面临两个关键挑战:探索-开发平衡问题以及处理大型动作空间。然而,缺乏能有效解决这些挑战的基于学习的方法。本文引入一种综合性表述以解决各种谈判问题。我们的做法利用情境组合型多臂老虎机,其中老虎机解决探索-开发平衡问题,组合特性处理大型动作空间。建立在此表述基础上,我们提出一种新方法NegUCB,同样处理诸如部分观察和复杂奖励函数等常见问题。NegUCB是情境化的,针对完全老虎机反馈,奖励函数无约束。在温和假设下,它确保次线性懊悼上界。在三个谈判任务上的实验表明,我们的方法优越性。

关键词

引用

@article{arxiv.2407.00567,
  title  = {A Contextual Combinatorial Bandit Approach to Negotiation},
  author = {Yexin Li and Zhancun Mu and Siyuan Qi},
  journal= {arXiv preprint arXiv:2407.00567},
  year   = {2024}
}