ESCA:通过场景图生成对具身智能体进行情境化建构
计算机视觉与模式识别
2025-10-28 v2 人工智能
机器学习
摘要
多模态大语言模型(MLLM)正在快速进步,朝着通用具身智能体的方向发展。然而,现有的 MLLM 无法可靠地捕捉低级视觉特征与高级文本语义之间的细粒度关联,导致粘性较弱和感知不准。为克服这一挑战,我们提出了 ESCA 框架,通过在时空场景图中对具身智能体的感知进行情境化建构。其核心是 SGCLIP,这是一个新颖的、开放领域的、可提示的基于 CLIP 的场景图生成基础模型。SGCLIP 采用神经符号管道在 87K+ 开放领域视频上进行训练,该管道将自动生成的标题与模型自身生成的场景图对齐,无需人工标注。我们展示了 SGCLIP 在基于提示的推理和任务特定微调方面都表现卓越,在场景图生成和动作定位基准测试中实现了最先进的效果。ESCA 使用 SGCLIP 可提升基于开源和商业 MLLM 的具身智能体感知,在两个具身环境中实现了最先进的性能。值得注意的是,ESCA 显著减少了智能体感知错误,使开源模型超越专有基线。我们发布了 SGCLIP 模型训练的源码(https://github.com/video-fm/LASER)以及具身智能体的源码(https://github.com/video-fm/ESCA)。
引用
@article{arxiv.2510.15963,
title = {ESCA: Contextualizing Embodied Agents via Scene-Graph Generation},
author = {Jiani Huang and Amish Sethi and Matthew Kuo and Mayank Keoliya and Neelay Velingker and JungHo Jung and Ser-Nam Lim and Ziyang Li and Mayur Naik},
journal= {arXiv preprint arXiv:2510.15963},
year = {2025}
}
备注
Accepted as a Spotlight Paper at NeurIPS 2025