DyGEnc:编码文本场景图序列以推理并回答动态场景中的问题
计算机视觉与模式识别
2025-05-07 v1
摘要
动态环境中的事件分析是开发能够与人类交互的智能体和机器人的一个根本性挑战。当前的方法主要利用视觉模型。然而,这些方法通常从图像中隐式地捕获信息,缺乏可解释的时空对象表示。为了解决这个问题,我们引入了 DyGEnc——一种编码动态图的新方法。该方法将压缩的时空结构观察表示与大型语言模型的认知能力相结合。这种集成的目的是基于文本场景图序列实现高级问答。在 STAR 和 AGQA 数据集上的扩展评估表明,DyGEnc 在处理关于人-物交互历史的查询方面,以 15-25% 的大幅优势优于现有的视觉方法。此外,所提出的方法可以无缝扩展,利用基础模型从原始输入图像中提取显式的文本场景图,这一点已由在轮式机械臂平台上进行的机器人实验的结果所证实。我们希望这些发现将有助于实现用于长程推理的鲁棒且压缩的基于图的机器人记忆。代码可在 github.com/linukc/DyGEnc 获取。
引用
@article{arxiv.2505.03581,
title = {DyGEnc: Encoding a Sequence of Textual Scene Graphs to Reason and Answer Questions in Dynamic Scenes},
author = {Sergey Linok and Vadim Semenov and Anastasia Trunova and Oleg Bulichev and Dmitry Yudin},
journal= {arXiv preprint arXiv:2505.03581},
year = {2025}
}
备注
8 pages, 5 figures, 6 tables