中文

上下文好奇心:针对多臂老虎机任务中决策预训练Transformer的探索蒸馏

机器学习 2025-10-02 v1 人工智能 多智能体系统

摘要

随着大型语言模型(LLM)能力的不断提升,将其纳入决策任务的兴趣日益增长。实现这一目标的常用流程是决策预训练Transformer(DPT)。然而,现有的DPT训练方法通常难以泛化到其预训练数据分布之外。为了探索缓解这一局限性,我们提出了上下文好奇心——一种用于离线预训练的轻量级、受探索启发的正则化器,并引入了预测驱动Transformer(PPT)框架。PPT用一个辅助奖励预测器增强了DPT,使用预测误差作为内在好奇心信号,以鼓励在训练期间进行更广泛的探索。在高斯多臂老虎机的概念验证实验中,PPT展现出了更好的鲁棒性:当测试环境在奖励上表现出更高的方差时,它缓解了在DPT中观察到的性能下降,特别是在预训练数据多样性有限的情况下。尽管离线数据的质量仍然是根本,但我们的初步结果表明,好奇心驱动的预训练为增强上下文强化学习智能体的分布外泛化能力提供了一个有前景的方向。

关键词

引用

@article{arxiv.2510.00347,
  title  = {In-Context Curiosity: Distilling Exploration for Decision-Pretrained Transformers on Bandit Tasks},
  author = {Huitao Yang and Guanting Chen},
  journal= {arXiv preprint arXiv:2510.00347},
  year   = {2025}
}