中文

面向目标导向视觉对话中描述性提问生成的统一提问者 Transformer

计算机视觉与模式识别 2021-06-30 v1

摘要

构建能够就真实世界提问的交互式人工智能是视觉与语言问题的最大挑战之一。特别是目标导向视觉对话,其中智能体的目标是在轮流对话中通过提问来获取信息,近来受到学界关注。尽管已提出若干基于 GuessWhat?! 数据集的现有模型,提问者通常提出简单的基于类别的问题或绝对空间问题。这对于物体共享属性的复杂场景,或需要描述性问题来区分物体的情况可能存在问题。在本文中,我们提出一种新颖的提问者架构,称为统一提问者 Transformer(UniQer),用于带指代表达的描述性提问生成。此外,我们构建了一个称为 CLEVR Ask 的目标导向视觉对话任务。它合成需要提问者生成描述性问题的复杂场景。我们用 CLEVR Ask 数据集的两个变体训练我们的模型。定量与定性评估结果表明 UniQer 优于基线。

关键词

引用

@article{arxiv.2106.15550,
  title  = {Unified Questioner Transformer for Descriptive Question Generation in Goal-Oriented Visual Dialogue},
  author = {Shoya Matsumori and Kosuke Shingyouchi and Yuki Abe and Yosuke Fukuchi and Komei Sugiura and Michita Imai},
  journal= {arXiv preprint arXiv:2106.15550},
  year   = {2021}
}