通过对话补充缺失视觉信息以生成场景图
计算机视觉与模式识别
2024-04-02 v2
摘要
当前多数 AI 系统依赖于输入视觉数据充分、从而在各类计算机视觉任务中取得有竞争力性能的前提。然而,经典任务设定很少考虑这样一种具挑战性却常见的实际情形:因各种原因(如视野受限与遮挡)完整视觉数据可能无法获取。为此,我们研究一种具有不完整视觉输入数据的计算机视觉任务设定。具体而言,我们以场景图生成(SGG)任务为对象,输入为不同缺失程度的视觉数据。尽管视觉输入不足直观上会导致性能下降,我们提出通过自然语言对话交互来补充缺失视觉信息,以更好地达成任务目标。我们设计了一个与模型无关的补充性交互对话(SI-Dial)框架,可与多数现有模型联合学习,赋予当前 AI 系统以自然语言进行问答交互的能力。我们通过大量实验与分析,证明了该缺失视觉输入任务设定的可行性,以及我们所提对话模块作为补充信息源的有效性——其在多个基线上实现了可观的性能提升。
引用
@article{arxiv.2204.11143,
title = {Supplementing Missing Visions via Dialog for Scene Graph Generations},
author = {Zhenghao Zhao and Ye Zhu and Xiaoguang Zhu and Yuzhang Shang and Yan Yan},
journal= {arXiv preprint arXiv:2204.11143},
year = {2024}
}
备注
ICASSP 2024