O3D:面向大语言模型序贯决策的离线数据驱动发现与蒸馏
人工智能
2024-02-27 v5 计算与语言
摘要
大语言模型(LLMs)近期的进展在求解序贯决策问题方面展现出良好性能。通过模仿提示中提供的少样本示例(即上下文学习),LLM 智能体可与外部环境交互并在无需额外训练的情况下完成任务。然而,此类少样本示例往往不足以对复杂长程任务生成高质量解,且有限的上下文长度无法容纳具有长交互程的大规模演示。为此,我们提出一种离线学习框架,利用大规模离线数据(如人类交互日志)改进 LLM 驱动的策略而无需微调。所提方法 O3D(Offline Data-driven Discovery and Distillation,离线数据驱动发现与蒸馏)基于离线交互数据自动发现可复用技能并跨多任务蒸馏可泛化知识,提升下游任务求解能力。在两个交互式决策基准(ALFWorld 和 WebShop)上的实证结果验证了 O3D 可通过离线发现与蒸馏过程显著增强 LLM 的决策能力,并在各类 LLM 上持续优于基线。
引用
@article{arxiv.2310.14403,
title = {O3D: Offline Data-driven Discovery and Distillation for Sequential Decision-Making with Large Language Models},
author = {Yuchen Xiao and Yanchao Sun and Mengda Xu and Udari Madhushani and Jared Vann and Deepeka Garg and Sumitra Ganesh},
journal= {arXiv preprint arXiv:2310.14403},
year = {2024}
}