中文

基于近端策略优化的 IRGAN 收敛性改进

信息检索 2019-10-02 v1 机器学习

摘要

IRGAN 是一种信息检索(IR)建模方法,它利用生成模型与判别模型之间的理论极小极大博弈来迭代优化二者,从而统一了生成式与判别式方法。尽管在若干信息检索任务上取得了显著的性能提升,IRGAN 的训练过程不稳定,且解随随机参数初始化而有很大差异。在本工作中,我们提出了一种基于近端策略优化目标以及基于 Gumbel-Softmax 的生成器采样改进训练目标。我们还提出了一种改进的训练算法,在每一步迭代中对生成器和判别器各进行一次梯度更新。我们给出了经验证据,表明所提模型相较原始 IRGAN 具有改进的收敛性,并讨论了在基准数据集上三个不同 IR 任务的对比,强调了所提模型的优越性能。

关键词

引用

@article{arxiv.1910.00352,
  title  = {Proximal Policy Optimization for Improved Convergence in IRGAN},
  author = {Moksh Jain and Sowmya Kamath S},
  journal= {arXiv preprint arXiv:1910.00352},
  year   = {2019}
}

备注

5 pages. Smooth Games Optimization and Machine Learning Workshop (NeurIPS 2019)