中文

基于实体的策略学习与增强猜测器提升视觉对话提问者

计算与语言 2021-09-07 v1 人工智能

摘要

鉴于构建优秀的视觉对话(VD)提问者的重要性,许多研究者在 Q-Bot-A-Bot 图像猜测游戏设定下探讨该主题,其中提问者需提出一系列问题以收集未公开图像的信息。尽管监督学习(SL)与强化学习(RL)已取得进展,问题依然存在。首先,先前方法未为提问者生成视觉相关且信息丰富的问题提供明确有效的引导。其次,RL 的效果受限于一个薄弱组件,即猜测器(Guesser)——其基于生成的对话进行图像预测并相应分配奖励。为增强 VD 提问者:1)我们提出相关实体增强的提问者(ReeQ),在相关实体引导下生成问题,并从人类对话中学习基于实体的提问策略;2)我们提出增强猜测器(AugG),其性能强大且专门针对 VD 设定优化。在 VisDial v1.0 数据集上的实验结果表明,我们的方法在图像猜测任务与问题多样性上均达到最先进(state-of-the-art)性能。人类评估进一步证明我们的模型生成了更具视觉相关性、信息量与连贯性的问题。

关键词

引用

@article{arxiv.2109.02297,
  title  = {Enhancing Visual Dialog Questioner with Entity-based Strategy Learning and Augmented Guesser},
  author = {Duo Zheng and Zipeng Xu and Fandong Meng and Xiaojie Wang and Jiaan Wang and Jie Zhou},
  journal= {arXiv preprint arXiv:2109.02297},
  year   = {2021}
}

备注

Accepted by Findings of EMNLP 2021. Code is available at: https://github.com/zd11024/Entity_Questioner