结构化预测的 Softmax Q-分布估计:对 RAML 的理论解释
机器学习
2017-10-31 v3 计算与语言
机器学习
摘要
奖励增强最大似然(Reward augmented maximum likelihood, RAML)是一种简单有效的学习框架,可在结构化预测任务中直接针对奖励函数进行优化,已取得一系列令人瞩目的实证成功。RAML 通过对按指数化回报分布采样的候选输出执行最大似然更新来融入任务特定奖励,该分布赋予接近参考输出的候选结果更高概率。尽管 RAML 以其简洁性、高效性和显著的实证效果著称,但其理论性质,尤其是指数化回报分布的行为,尚未得到深入探讨。本文引入 softmax Q-分布估计,作为对 RAML 的一种新颖理论解释,揭示了 RAML 与贝叶斯决策理论之间的关系。softmax Q-分布可视为贝叶斯决策边界的平滑近似,通过使用该 Q-分布进行解码即可实现贝叶斯决策规则。我们进一步证明,RAML 等价于对 softmax Q-分布进行近似估计,其中温度参数 控制近似误差。我们进行了两项实验,一项在多类分类的合成数据上,另一项在图像描述的真实数据上,以展示 RAML 与所提出的 softmax Q-分布估计方法之间的关系,验证了我们的理论分析。在三个结构化预测任务上的额外实验——其奖励分别定义在序列(命名实体识别)、树形(依存句法分析)和非规则(机器翻译)结构上——显示出相对于最大似然基线的显著改进。
引用
@article{arxiv.1705.07136,
title = {Softmax Q-Distribution Estimation for Structured Prediction: A Theoretical Interpretation for RAML},
author = {Xuezhe Ma and Pengcheng Yin and Jingzhou Liu and Graham Neubig and Eduard Hovy},
journal= {arXiv preprint arXiv:1705.07136},
year = {2017}
}
备注
Under Review of ICLR 2018