中文

学习何时不学习:无界奖励情景下的风险敏感回避策略

机器学习 2026-04-14 v3 人工智能

摘要

在高风险 AI 应用中,单次行动可能造成不可逆损害。然而,几乎所有序列决策理论都假设所有错误都是可恢复的(例如,通过对奖励进行上界限制)。标准的多臂赫芙里亚林算法进行激进探索可能在此假设失效时导致不可逆损害。一些先前工作通过向导师寻求帮助来避免不可逆错误,但导师未必总是可用。在本文中,我们将缺乏导师的无界奖励学习问题形式化为一种具有回避选项的两动作情境式多臂赫芙里亚林问题:在每个回合,智能体观察输入并选择回避(总为 0 奖励)或提交(执行预存在的任务策略)。提交操作产生的奖励上界为正,但可以是任意负数,且提交奖励假设相对于输入满足 Lipschitz 条件。我们提出一种谨慎的算法,即学习何时不学习:它选择一个可信赖的区域,仅在可用证据尚未确认有害的地方进行提交。在满足上述条件且输入独立同分布的情况下,我们建立亚线性懊悼保证,理论上展示了在高风险环境中部署学习智能体的谨慎探索的有效性。

关键词

引用

@article{arxiv.2510.14884,
  title  = {Learning When Not to Learn: Risk-Sensitive Abstention in Bandits with Unbounded Rewards},
  author = {Sarah Liaw and Benjamin Plaut},
  journal= {arXiv preprint arXiv:2510.14884},
  year   = {2026}
}

备注

19 pages, 3 figures; accepted to AISTATS 2026