基于自省的元强化学习用于智能搜索
统计力学
2026-03-13 v1 无序系统与神经网络
软凝聚态物质
摘要
本文引入 MR-Search,这是一种面向具有自省能力的智能搜索的 in-context 元强化学习(RL)表述。与在单个独立剧集中优化稀疏奖励的传统方法不同,MR-Search 训练的策略能够依据历史剧集并在剧集之间调整其搜索策略。MR-Search 学习掌握具备自省能力的搜索策略,使搜索智能体在测试时能够在上下文中改进探索。具体而言,MR-Search 通过在每个剧集后生成显式自省反思,并将其作为额外上下文来引导后续尝试,从而在测试时促进更有效的探索。我们进一步引入一种多轮 RL 算法,该算法在每一轮水平上估计稠密相对优势,使每个剧集的细粒度信用分配成为可能。跨越多个基准的实验结果表明,MR-Search 相对于基于 RL 的基线具有显著优势,显示出强大的泛化能力,并在八个基准中实现 9.2% 至 19.3% 的相对改进。我们的代码和数据已公开于 https://github.com/tengxiao1/MR-Search
引用
@article{arxiv.2603.11326,
title = {Unraveling anomalous relaxation effects in the thermodynamic limit},
author = {Emilio Pomares and Víctor Martín-Mayor and Antonio Lasanta and Gabriel Álvarez},
journal= {arXiv preprint arXiv:2603.11326},
year = {2026}
}