中文

通过对话策略与语言生成的交替优化构建任务型视觉对话系统

计算与语言 2019-10-30 v2 人工智能 机器学习

摘要

强化学习(RL)是学习任务型视觉对话系统最优对话策略的有效方法。常见做法是在神经序列到序列(seq2seq)框架上应用RL,其动作空间为解码器中的输出词表。然而,设计能在学习有效策略与生成自然对话响应之间取得平衡的奖励函数是困难的。本文提出一种新颖框架,交替训练用于图像猜测的RL策略与有监督seq2seq模型以提升对话生成质量。我们在GuessWhich任务上评估我们的框架,该框架在任务完成度与对话质量上均达到了最先进(SOTA)性能。

关键词

引用

@article{arxiv.1909.05365,
  title  = {Building Task-Oriented Visual Dialog Systems Through Alternative Optimization Between Dialog Policy and Language Generation},
  author = {Mingyang Zhou and Josh Arnold and Zhou Yu},
  journal= {arXiv preprint arXiv:1909.05365},
  year   = {2019}
}

备注

updated with acknowledgement and minor typo fixes on tables