基础模型能否在交互环境中主动收集信息以检验假设?
机器学习
2025-10-08 v2 机器学习
摘要
基础模型擅长单轮推理,但在动态环境中的多轮探索方面存在困难,而这是许多现实挑战的要求。我们评估了这些模型从经验中学习、适应和收集信息的能力。首先,在"特征世界"——一个测试信息收集的简单设置中,模型表现接近最优。然而,为了测试更复杂的多试次学习,我们实现了一个基于文本的"Alchemy"环境,这是一个元学习基准。在此设置中,智能体必须通过跨多个试次整合信息来推断潜在的因果结构。在这种设置中,最近的基础模型最初未能在性能上随时间提升。关键的是,我们发现提示模型定期总结其观察结果能够催生一种涌现的元学习过程。这使它们能够在试次之间改进,甚至在环境规则意外改变时自适应地重新学习。虽然大多数模型能够处理简单任务,但 Alchemy 揭示了鲁棒性方面的显著差异:Gemini 2.5 表现最佳,其次是 Claude 3.7,而 ChatGPT-4o 和 o4-mini 表现不佳。这凸显了 Alchemy 作为基准的价值。我们的发现表明,基础模型面临的最大挑战不是即时选择信息性动作,而是通过随时间推移的自适应策略整合知识。令人鼓舞的是,未来模型掌握这些能力似乎不存在内在障碍。
引用
@article{arxiv.2412.06438,
title = {Can foundation models actively gather information in interactive environments to test hypotheses?},
author = {Danny P. Sawyer and Nan Rosemary Ke and Hubert Soyer and Martin Engelcke and David P Reichert and Drew A. Hudson and John Reid and Alexander Lerchner and Danilo Jimenez Rezende and Timothy P Lillicrap and Michael Mozer and Jane X Wang},
journal= {arXiv preprint arXiv:2412.06438},
year = {2025}
}