基于熵的上下文型多臂赫尔姆特人类反馈
人工智能
2025-02-14 v1
摘要
近年来,基于偏好的人类反馈机制已成为增强模型性能的关键手段,广泛应用于包括 ChatGPT 等对话式 AI 系统在内的各种应用。然而,现有方法往往忽视关键因素,如模型不确定性和反馈质量的变异性。为此,本文引入了一种用于上下文型多臂赫尔姆特的熵基人类反馈框架,通过当模型熵值超过预定义阈值时主动请求专家反馈来动态平衡探索与开发。该方法具有模型无关性,可无缝集成到任何采用随机策略的上下文型多臂赫尔姆特智能体中。通过全面实验,我们展示该方法在实现显著性能提升的同时,仅需最小人类反馈,即使在反馈质量次优的条件下亦表现出色。这项工作不仅提出了一种新颖的反馈 solicitation 策略,还突显了将人类指导纳入机器学习系统中的鲁棒性和有效性。我们的代码已公开:https://github.com/BorealisAI/CBHF
关键词
引用
@article{arxiv.2502.08759,
title = {Contextual bandits with entropy-based human feedback},
author = {Raihan Seraj and Lili Meng and Tristan Sylvain},
journal= {arXiv preprint arXiv:2502.08759},
year = {2025}
}