中文

来自记录人类反馈的离策略评估

机器学习 2024-06-17 v1 机器学习

摘要

从人类反馈中学习是人工智能和机器学习近期进步的核心环节。由于人类反馈的收集成本高昂,一个自然的问题是:是否总是需要收集新的反馈?或者我们能否仅凭对另一个模型响应的人类反馈来评估新模型?这促使我们研究如何从记录的人类反馈中进行离策略评估。我们对问题进行形式化建模,提出了基于模型和无模型的策略价值估计方法,并展示了如何对其进行优化。我们分析了所提估计方法的无偏性,并进行了经验评估。我们的估计方法能够预测被评估策略的绝对值、对其进行排序,并且可以被优化。

关键词

引用

@article{arxiv.2406.10030,
  title  = {Off-Policy Evaluation from Logged Human Feedback},
  author = {Aniruddha Bhargava and Lalit Jain and Branislav Kveton and Ge Liu and Subhojyoti Mukherjee},
  journal= {arXiv preprint arXiv:2406.10030},
  year   = {2024}
}