中文

HR-Bandit:人类-人工智能协作线性 recourse 多臂赫尔墨斯问题

机器学习 2025-03-21 v2

摘要

人类医生经常会建议可行的补救措施,使患者能够修改其病情以获取更有效的治疗。以此为灵感,我们提出 Recourse Linear UCB (RLinUCB\textsf{RLinUCB}) 算法,通过平衡探索与开发优化动作选择和特征修改。我们进一步将其扩展为人类-人工智能线性 recourse 多臂赫尔墨斯问题 (HR-Bandit\textsf{HR-Bandit}),将人类专长整合以提升性能。HR-Bandit\textsf{HR-Bandit} 提供三个关键保证:(i) 热启动保证以提高初始性能,(ii) 人类工作量保证最小化所需的人类交互,以及 (iii) 鲁棒性保证,即使人类决策次优,仍确保亚线性懊悼。实证结果,包括一个医疗案例研究,验证了其对现有基准的优越性能。

关键词

引用

@article{arxiv.2410.14640,
  title  = {HR-Bandit: Human-AI Collaborated Linear Recourse Bandit},
  author = {Junyu Cao and Ruijiang Gao and Esmaeil Keyvanshokooh},
  journal= {arXiv preprint arXiv:2410.14640},
  year   = {2025}
}

备注

18 pages, AISTATS 25