在多模态环境中学习物理动作的效果
计算与语言
2023-02-06 v2
摘要
大语言模型(LLMs)对物理常识信息的处理存在不足。由于在脱离实体的环境中训练,LLMs 常常无法预测给定环境中某一动作的结果。然而,在执行动作之前预测其效果对于规划至关重要,因为通常需要连贯的动作序列来实现目标。因此,我们引入了仅从真实感官输入(图像和文本)预测动作结果的多模态任务。接下来,我们扩展了一个 LLM 以建模对象的潜在表示,从而更好地预测环境中的动作结果。我们表明,当增强视觉信息时,多模态模型能够捕捉物理常识。最后,我们在新颖的动作和对象上评估了模型的性能,发现模态结合有助于模型更好地泛化并学习物理常识推理。
引用
@article{arxiv.2301.11845,
title = {Learning the Effects of Physical Actions in a Multi-modal Environment},
author = {Gautier Dagan and Frank Keller and Alex Lascarides},
journal= {arXiv preprint arXiv:2301.11845},
year = {2023}
}