来自记录人类反馈的离策略评估
机器学习
2024-06-17 v1 机器学习
摘要
从人类反馈中学习是人工智能和机器学习近期进步的核心环节。由于人类反馈的收集成本高昂,一个自然的问题是:是否总是需要收集新的反馈?或者我们能否仅凭对另一个模型响应的人类反馈来评估新模型?这促使我们研究如何从记录的人类反馈中进行离策略评估。我们对问题进行形式化建模,提出了基于模型和无模型的策略价值估计方法,并展示了如何对其进行优化。我们分析了所提估计方法的无偏性,并进行了经验评估。我们的估计方法能够预测被评估策略的绝对值、对其进行排序,并且可以被优化。
引用
@article{arxiv.2406.10030,
title = {Off-Policy Evaluation from Logged Human Feedback},
author = {Aniruddha Bhargava and Lalit Jain and Branislav Kveton and Ge Liu and Subhojyoti Mukherjee},
journal= {arXiv preprint arXiv:2406.10030},
year = {2024}
}