中文

规划策略发现认知机制中的个体差异

人工智能 2025-05-30 v1

摘要

人们采用高效的规划策略。但这些策略是如何习得的?先前的研究表明,人们可以通过强化学习发现新的规划策略,这一过程被称为元认知强化学习 (MCRL)。虽然先前的工作表明 MCRL 模型可以学习新的规划策略,并且比其他机制能更好地解释更多参与者基于经验的发现,但它也揭示了元认知学习中存在显著的个体差异。此外,在拟合人类数据时,这些模型表现出比人类更慢的策略发现速率。在本研究中,我们 investigates 融入可能促进人类策略发现的认知机制是否能使 MCRL 模型更接近人类表现。具体而言,我们考虑了内部生成的元认知伪奖励、主观努力评估和终止审议。对规划任务数据的分析表明,更大比例的参与者至少使用了这些机制中的一种,且其使用存在显著的个体差异,对策略发现的影响也各不相同。研究发现,元认知伪奖励、主观努力评估以及学习无需进一步规划即采取行动的价值有助于策略发现。虽然这些增强为个体差异以及这些机制对策略发现的影响提供了有价值的见解,但它们并未完全弥合模型与人类表现之间的差距,促使人们进一步探索人们可能用于发现新规划策略的其他因素。

关键词

引用

@article{arxiv.2505.23519,
  title  = {Individual differences in the cognitive mechanisms of planning strategy discovery},
  author = {Ruiqi He and Falk Lieder},
  journal= {arXiv preprint arXiv:2505.23519},
  year   = {2025}
}