中文

你在跟我说话吗?基于对抗学习的推理式视觉对话生成

计算机视觉与模式识别 2017-11-22 v1 人工智能 计算与语言

摘要

视觉对话任务要求智能体就一幅图像与人类进行对话。它代表了视觉问答任务的扩展:智能体需要回答关于图像的问题,但必须结合已发生的先前对话来作答。因此,视觉对话的关键挑战在于保持连贯自然的对话,同时持续正确回答问题。我们提出了一种结合强化学习(Reinforcement Learning)与生成对抗网络(GANs)的新方法,以生成更类人的问题回答。GAN有助于克服训练数据相对匮乏,以及典型基于最大似然估计(MLE)的方法倾向于生成过于简短答案的问题。关键在于,GAN被紧密集成到注意力机制中,该机制为每个答案生成人类可解释的理由。这意味着GAN的判别模型需要在给定理由的条件下,判断候选答案是由人类还是机器生成的。这一点十分重要,因为它驱动生成模型产生由相应推理充分支撑的高质量答案。该方法还在主要基准上取得了当前最优(state-of-the-art)结果。

关键词

引用

@article{arxiv.1711.07613,
  title  = {Are You Talking to Me? Reasoned Visual Dialog Generation through Adversarial Learning},
  author = {Qi Wu and Peng Wang and Chunhua Shen and Ian Reid and Anton van den Hengel},
  journal= {arXiv preprint arXiv:1711.07613},
  year   = {2017}
}