利用基于不确定性意识的大型语言模型引导强化学习
计算与语言
2024-11-25 v1 人工智能
信息检索
摘要
人类对强化学习(RL)的指导往往因高昂成本和时间限制而在大规模应用中不切实际。大型语言模型(LLM)为缓解 RL 样本效率低下问题并潜在取代人类教练者提供了广阔前景。然而,将 LLM 作为 RL 教练者具有挑战,因其在顺序任务中的过度自信和解决方案可靠性较低。我们通过引入校准的指导系统,使用蒙特卡洛 Dropout 提升 LLM 建议的可靠性,通过评估多个前向传递的预测方差来实现这一目标。此外,我们开发了一种基于动态模型平均熵的新型 RL 策略塑形方法,以根据指导不确定性调整 LLM 对 RL 策略的影响。该方法确保通过可靠的 LLM 指导实现稳健的 RL 训练。为验证我们的贡献,我们在大小各异的 Minigrid 环境中进行了广泛实验,包含三个目标。结果表明,相较于未校准的 LLM、无指导的 RL 以及使用不同塑形策略的校准 LLM,本方法在模型性能上表现出优势。此外,我们分析了 various 不确定性估计方法,证明了平均熵在反映错误指导的更高不确定性方面的有效性。这些发现凸显了精调 LLM 中持续的过度自信,并强调了在序列决策问题中有效校准的重要性。
关键词
引用
@article{arxiv.2411.14456,
title = {Can Artificial Intelligence Generate Quality Research Topics Reflecting Patient Concerns?},
author = {Jiyeong Kim and Michael L. Chen and Shawheen J. Rezaei and Mariana Ramirez-Posada and Jennifer L. Caswell-Jin and Allison W. Kurian and Fauzia Riaz and Kavita Y. Sarin and Jean Y. Tang and Steven M. Asch and Eleni Linos},
journal= {arXiv preprint arXiv:2411.14456},
year = {2024}
}