将策略梯度作为成分句法分析中动态预言机的替代方案
计算与语言
2018-06-11 v1
摘要
动态预言机为带探索训练成分句法分析器提供了强监督,但必须针对给定分析器的转移系统定制定义。我们探索使用策略梯度方法作为一种与解析器无关的替代方案。除了直接优化如 F1 这类树级指标外,策略梯度还有望通过在训练中允许探索来减轻暴露偏差;此外,它不需要动态预言机进行监督。在三种语言上的四个成分句法分析器中,该方法在几乎所有设置下都大幅优于静态预言机似然训练。对于可提供动态预言机的分析器(包括我们为 Dyer 等人 2016 的转移系统定义的一个新预言机),策略梯度通常能重新获得动态预言机所带来的相当一部分性能提升。
引用
@article{arxiv.1806.03290,
title = {Policy Gradient as a Proxy for Dynamic Oracles in Constituency Parsing},
author = {Daniel Fried and Dan Klein},
journal= {arXiv preprint arXiv:1806.03290},
year = {2018}
}
备注
ACL 2018