HR-Bandit:人类-人工智能协作线性 recourse 多臂赫尔墨斯问题
机器学习
2025-03-21 v2
摘要
人类医生经常会建议可行的补救措施,使患者能够修改其病情以获取更有效的治疗。以此为灵感,我们提出 Recourse Linear UCB () 算法,通过平衡探索与开发优化动作选择和特征修改。我们进一步将其扩展为人类-人工智能线性 recourse 多臂赫尔墨斯问题 (),将人类专长整合以提升性能。 提供三个关键保证:(i) 热启动保证以提高初始性能,(ii) 人类工作量保证最小化所需的人类交互,以及 (iii) 鲁棒性保证,即使人类决策次优,仍确保亚线性懊悼。实证结果,包括一个医疗案例研究,验证了其对现有基准的优越性能。
引用
@article{arxiv.2410.14640,
title = {HR-Bandit: Human-AI Collaborated Linear Recourse Bandit},
author = {Junyu Cao and Ruijiang Gao and Esmaeil Keyvanshokooh},
journal= {arXiv preprint arXiv:2410.14640},
year = {2025}
}
备注
18 pages, AISTATS 25