基于情境组合型多臂老虎机的谈判方法
人工智能
2024-07-02 v1 机器学习
摘要
学习有效的谈判策略面临两个关键挑战:探索-开发平衡问题以及处理大型动作空间。然而,缺乏能有效解决这些挑战的基于学习的方法。本文引入一种综合性表述以解决各种谈判问题。我们的做法利用情境组合型多臂老虎机,其中老虎机解决探索-开发平衡问题,组合特性处理大型动作空间。建立在此表述基础上,我们提出一种新方法NegUCB,同样处理诸如部分观察和复杂奖励函数等常见问题。NegUCB是情境化的,针对完全老虎机反馈,奖励函数无约束。在温和假设下,它确保次线性懊悼上界。在三个谈判任务上的实验表明,我们的方法优越性。
引用
@article{arxiv.2407.00567,
title = {A Contextual Combinatorial Bandit Approach to Negotiation},
author = {Yexin Li and Zhancun Mu and Siyuan Qi},
journal= {arXiv preprint arXiv:2407.00567},
year = {2024}
}