中文

基于直接偏好的决斗_bandit 进化多目标优化

人工智能 2025-03-10 v2

摘要

优化问题在单目标与多目标场景中均广泛应用。在实际应用中,用户期望解能沿帕累托前沿(PF)收敛至感兴趣区域(ROI)。传统方法通过近似适应度函数或目标函数以反映用户偏好,本文则探索另一条路径。具体而言,我们旨在发现一种无需计算适应度函数、仅依赖人类反馈的方法。我们提出的方法借助主动决斗_bandit 算法开展直接偏好学习。实验阶段分为三节。首先,我们评估主动决斗_bandit 算法的性能。其次,我们在多目标进化算法(MOEAs)框架下实现所提方法。最后,我们将该方法部署于实际问题,具体为蛋白质结构预测(PSP)。本研究提出了一种新颖的基于交互偏好的 MOEA 框架,不仅克服了传统技术的局限,也为优化问题开启了新的可能。

关键词

引用

@article{arxiv.2311.14003,
  title  = {Direct Preference-Based Evolutionary Multi-Objective Optimization with Dueling Bandit},
  author = {Tian Huang and Shengbo Wang and Ke Li},
  journal= {arXiv preprint arXiv:2311.14003},
  year   = {2025}
}