IMO$^3$:交互式多目标离策略优化
机器学习
2022-01-26 v2 计算工程、金融与科学
摘要
大多数现实世界的优化问题具有多个目标。系统设计者需要找到一个能在这些目标之间权衡以达到期望工作点的策略。在目标函数已知的设定下,该问题已被广泛研究。我们考虑一个更实际但更具挑战性的设定:目标函数未知。在工业界,该问题主要通过在线 A/B 测试来解决,这通常成本高昂且效率低下。作为一种替代方案,我们提出了交互式多目标离策略优化(IMO)。我们方法的核心思想是,利用以离策略方式评估的策略与系统设计者进行交互,以揭示哪个策略能最大化其未知的效用函数。我们从理论上证明,IMO 能以高概率识别出近最优策略,这取决于来自设计者的反馈量以及用于离策略估计的训练数据量。我们在多个多目标优化问题上通过实验证明了其有效性。
引用
@article{arxiv.2201.09798,
title = {IMO$^3$: Interactive Multi-Objective Off-Policy Optimization},
author = {Nan Wang and Hongning Wang and Maryam Karimzadehgan and Branislav Kveton and Craig Boutilier},
journal= {arXiv preprint arXiv:2201.09798},
year = {2022}
}