基于场景图的增量式物体定位
计算机视觉与模式识别
2022-11-15 v2 计算与语言
摘要
物体定位任务旨在通过语言交流在图像中定位目标物体。理解人类指令对于有效的人机交流是一个重要过程。然而这具有挑战性,因为人类指令可能存在歧义且包含错误。本文旨在通过让智能体基于从场景图中获取的语义数据提出相关问题,来消除人类指称表达的歧义。我们测试了智能体能否利用场景图中物体之间的关系提出在语义上相关的问题,从而消除原始用户指令的歧义。本文提出基于场景图的增量式定位(IGSG),这是一种消歧模型,利用图像场景图的语义数据和语言场景图的语言结构,根据人类指令对物体进行定位。与基线相比,IGSG在存在多个相同目标物体的复杂真实场景中也展现出有前景的结果。IGSG能够通过向用户反问消歧问题,有效消除歧义或错误的指称表达。
引用
@article{arxiv.2201.01901,
title = {Incremental Object Grounding Using Scene Graphs},
author = {John Seon Keun Yi and Yoonwoo Kim and Sonia Chernova},
journal= {arXiv preprint arXiv:2201.01901},
year = {2022}
}