CM-DQN:用于模拟确认偏差的值基深度强化学习模型
机器学习
2024-08-09 v3
摘要
在人类决策任务中,个体通过试验和预测误差进行学习。当个体学习任务时,一些人更受良好结果的影响,而另一些人则更重视差坏结果。这种确认偏差可能导致不同的学习效果。在本研究中,我们提出了一种新的深度强化学习算法CM-DQN,该算法应用不同的正负预测误差更新策略,以模拟在状态连续而动作离散的任务中人类决策过程的行为。我们在Lunar Lander环境中进行测试,分别测试具有确认偏差、反证偏差和无偏差的情况,以观察学习效果。此外,我们将确认模型应用于多臂老虎机问题(状态和动作均为离散),该问题采用与我们提出的算法相同的思想,作为算法性地模拟不同确认偏差在决策过程中影响的对照实验。在两种实验中,确认偏差表现出更好的学习效果。
关键词
引用
@article{arxiv.2407.07454,
title = {CM-DQN: A Value-Based Deep Reinforcement Learning Model to Simulate Confirmation Bias},
author = {Jiacheng Shen and Lihan Feng},
journal= {arXiv preprint arXiv:2407.07454},
year = {2024}
}