VLM 代理生成自身记忆:通过文本到图像模型的经验蒸馏生成具身思维程序
计算机视觉与模式识别
2025-09-19 v6 人工智能
机器学习
摘要
大规模生成语言和视觉语言模型(LLMs 和 VLMs)在少样本学习方面表现出色,但需要高质量的演示。我们提出了“情境抽象学习”(ICAL),使 VLM 代理能够通过自我反思和人类反馈将次优轨迹转化为高质量训练数据。给定不完美的任务演示后,VLM 抽象出轨迹以形成通用策略和动作注释,通过纠正不效率并标注认知抽象:因果关系、物体状态变化、时间子目标以及任务相关的视觉元素。这些注释在类似环境中通过人类反馈不断细化。生成的示例在检索增强生成或微调时显著提升决策质量。随着代理的示例库不断扩大,其抽象新示例的效率也提升,人类反馈和环境交互需求相应降低。ICAL 在多个基准测试中实现了最佳结果。在 TEACh 对话式指令跟随任务中,结合微调和检索的 ICAL 示例相较于原始人类演示和专家示例提升了 17.5% 的目标条件成功率。在 VisualWebArena 中,检索增强的 GPT-4V 结合 ICAL 实现了 1.6 倍的任务成功率,而微调的 Qwen2-VL 相较于基础模型提升了 2.8 倍。在 Ego4D 动作预测任务中,我们超越了少样本 GPT-4V,并与监督模型保持竞争力。我们的做法比原始演示的规模提升了 2 倍,显著降低了手动提示工程的需求。
引用
@article{arxiv.2406.14596,
title = {VLM Agents Generate Their Own Memories: Distilling Experience into Embodied Programs of Thought},
author = {Gabriel Sarch and Lawrence Jang and Michael J. Tarr and William W. Cohen and Kenneth Marino and Katerina Fragkiadaki},
journal= {arXiv preprint arXiv:2406.14596},
year = {2025}
}
备注
Project website: https://ical-learning.github.io/