中文

用于奖励学习的主动教师选择

人工智能 2026-05-11 v3 机器学习

摘要

奖励学习技术使机器学习系统能够从人类反馈中学习目标。这些系统的一个核心局限是假设所有反馈均来自单一人类教师,尽管其从庞大且异质的群体中收集反馈。我们提出隐效用强盗(HUB)框架,以建模教师在理性、专业性与成本上的差异,形式化从多教师学习的问题。我们开发了多种求解算法,并将其应用于两个真实领域:论文推荐系统与COVID-19疫苗测试。我们发现主动教师选择(ATS)算法通过主动选择查询时机与查询教师,优于基线方法。我们的关键贡献为:1)HUB框架:用于建模教师选择问题的新颖数学框架;2)ATS:一种基于主动学习的算法方法,展示了建模教师异质性的效用;3)HUB框架与ATS方法的概念验证应用,用于建模并解决具有奖励学习与优化间复杂权衡的多个真实问题。

关键词

引用

@article{arxiv.2310.15288,
  title  = {Active teacher selection for reward learning},
  author = {Rachel Freedman and Justin Svegliato and Kyle Wray and Stuart Russell},
  journal= {arXiv preprint arXiv:2310.15288},
  year   = {2026}
}