利用符号世界知识从自我中心视觉中定位主动对象
计算机视觉与模式识别
2023-10-24 v1 计算与语言
摘要
从自我中心视角主动接地任务指令的能力,对于AI智能体完成任务或虚拟辅助人类至关重要。实现该目标的重要一步是在未明确告知接地对象/位置的情况下,定位并跟踪因人类对环境的作用/交互而发生主要状态变化的关键主动对象(例如,根据指令“将‘海绵’浸入桶中”从视频中定位并跟踪‘海绵’)。现有工作从纯视觉角度处理该问题,我们则探究文本模态(即任务指令)及其与视觉模态的交互在多大程度上有益。具体而言,我们提出通过以下方式提升短语接地模型定位主动对象的能力:(1) 学习“发生变化的对象”的角色并从中准确提取指令中的此类对象;(2) 利用对象在动作前后的前件与后件条件;(3) 借助描述性知识更鲁棒地识别对象。我们利用大语言模型(LLMs)提取上述动作-对象知识,并设计逐对象聚合掩码技术,以有效对对象短语与符号知识进行联合推断。我们在Ego4D与Epic-Kitchens数据集上评估我们的框架。大量实验证明了我们所提框架的有效性,其在TREK-150-OPE-Det定位+跟踪任务上所有标准指标提升>54%,在TREK-150-OPE跟踪任务上所有标准指标提升>7%,在Ego4D SCOD任务上平均精度(AP)提升>3%。
引用
@article{arxiv.2310.15066,
title = {Localizing Active Objects from Egocentric Vision with Symbolic World Knowledge},
author = {Te-Lin Wu and Yu Zhou and Nanyun Peng},
journal= {arXiv preprint arXiv:2310.15066},
year = {2023}
}
备注
In Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP)