Plant in Cupboard, Orange on Rably, Inat Aphone. 基于文本模拟的情境与语言模型增量学习基准测试
计算与语言
2025-06-30 v3
摘要
大型语言模型(LLM)不仅作为聊天机器人发挥作用,还作为代理系统的关键组件,其中其常识知识显著影响以语言为基础的计划程序在具身或情境化动作中的性能。我们评估了LLM的增量学习能力(基于来自环境的反馈)和受控情境学习能力,方法是将其置于基于文本的环境中。我们引入了一组具有挑战性且有趣的实验,以测试i)代理如何通过在家中典型房间内的交互来逐步解决与日常物品相关的任务,ii)通过提供关于物品和房间位置的简短信息来检验代理的受控情境学习能力与效率,以加快任务解决速度,以及iii)使用合成伪英语单词来衡量LLM从环境反馈中推断未知单词意义的能力。结果表明,较大的商业模型在性能上存在与开源权重模型的显著差距,尽管所有模型在合成单词实验中都表现出困难。
引用
@article{arxiv.2502.11733,
title = {Plant in Cupboard, Orange on Rably, Inat Aphone. Benchmarking Incremental Learning of Situation and Language Model using a Text-Simulated Situated Environment},
author = {Jonathan Jordan and Sherzod Hakimov and David Schlangen},
journal= {arXiv preprint arXiv:2502.11733},
year = {2025}
}
备注
Accepted at The 28th International Conference of Text, Speech and Dialogue (TSD2025)