用于远程监督中实例选择的后验正则化 REINFORCE
计算与语言
2019-04-18 v1 机器学习
摘要
本文提供了一种提高 REINFORCE 训练过程效率的新方法。我们将其应用于远程监督中的实例选择任务。将一个包中的实例选择建模为序列决策过程,训练强化学习智能体以确定某个实例是否有价值,并构建一个包含较少噪声实例的新包。然而,诸如 REINFORCE 之类的无偏方法通常需要大量时间进行训练。本文采用后验正则化 (Posterior Regularization, PR),将一些特定领域的规则整合到使用 REINFORCE 的实例选择中。实验结果表明,该方法显著提升了在清洗后的远程监督数据集上训练的关系分类器的性能,同时提高了 REINFORCE 训练的效率。
引用
@article{arxiv.1904.08051,
title = {Posterior-regularized REINFORCE for Instance Selection in Distant Supervision},
author = {Qi Zhang and Siliang Tang and Xiang Ren and Fei Wu and Shiliang Pu and Yueting Zhuang},
journal= {arXiv preprint arXiv:1904.08051},
year = {2019}
}
备注
Five pages