大语言模型能否进行上下文探索?
机器学习
2024-10-30 v3 人工智能
计算与语言
摘要
我们研究了当代大语言模型(LLM)能在多大程度上进行探索,这是强化学习和决策中的一项核心能力。我们关注现有LLM的原始性能,不进行训练干预。我们将LLM作为智能体部署在简单的多臂赌博机环境中,完全在上下文(即LLM提示词内)指定环境描述和交互历史。我们使用多种提示设计对GPT-3.5、GPT-4和Llama2进行了实验,发现这些模型在没有实质性干预的情况下无法鲁棒地进行探索:i)在我们所有的实验中,只有一种配置产生了令人满意的探索行为:GPT-4配合思维链推理和以充分统计量形式呈现的外部总结交互历史;ii)所有其他配置均未产生鲁棒的探索行为,包括那些使用思维链推理但历史未总结的配置。尽管这些发现可以作积极解读,但它们表明外部总结——在更复杂的环境中可能无法实现——对于从LLM智能体获得理想行为至关重要。我们得出结论,可能需要非平凡的算法干预,如微调或数据集编目,才能使基于LLM的决策智能体在复杂环境中发挥作用。
引用
@article{arxiv.2403.15371,
title = {Can large language models explore in-context?},
author = {Akshay Krishnamurthy and Keegan Harris and Dylan J. Foster and Cyril Zhang and Aleksandrs Slivkins},
journal= {arXiv preprint arXiv:2403.15371},
year = {2024}
}
备注
Accepted to NeurIPS 2024. This version: added references to related and concurrent work