中文

利用符号世界知识从自我中心视觉中定位主动对象

计算机视觉与模式识别 2023-10-24 v1 计算与语言

摘要

从自我中心视角主动接地任务指令的能力,对于AI智能体完成任务或虚拟辅助人类至关重要。实现该目标的重要一步是在未明确告知接地对象/位置的情况下,定位并跟踪因人类对环境的作用/交互而发生主要状态变化的关键主动对象(例如,根据指令“将‘海绵’浸入桶中”从视频中定位并跟踪‘海绵’)。现有工作从纯视觉角度处理该问题,我们则探究文本模态(即任务指令)及其与视觉模态的交互在多大程度上有益。具体而言,我们提出通过以下方式提升短语接地模型定位主动对象的能力:(1) 学习“发生变化的对象”的角色并从中准确提取指令中的此类对象;(2) 利用对象在动作前后的前件与后件条件;(3) 借助描述性知识更鲁棒地识别对象。我们利用大语言模型(LLMs)提取上述动作-对象知识,并设计逐对象聚合掩码技术,以有效对对象短语与符号知识进行联合推断。我们在Ego4D与Epic-Kitchens数据集上评估我们的框架。大量实验证明了我们所提框架的有效性,其在TREK-150-OPE-Det定位+跟踪任务上所有标准指标提升>54%,在TREK-150-OPE跟踪任务上所有标准指标提升>7%,在Ego4D SCOD任务上平均精度(AP)提升>3%。

关键词

引用

@article{arxiv.2310.15066,
  title  = {Localizing Active Objects from Egocentric Vision with Symbolic World Knowledge},
  author = {Te-Lin Wu and Yu Zhou and Nanyun Peng},
  journal= {arXiv preprint arXiv:2310.15066},
  year   = {2023}
}

备注

In Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP)