中文

探究最大似然序列模型的解码器:一种前瞻方法

计算与语言 2020-03-10 v1

摘要

我们展示了如何实际地将多步未来信息融入最大似然序列模型的解码器中。我们提出一种“k 步前瞻”模块,以考虑至多 k 步展开(rollout)的似然信息。不同于其他需训练另一价值网络来评估展开的方法,我们可直接应用该前瞻模块改进任何在最大似然框架下训练的序列模型的解码。我们在三个不同难度的数据集上评估前瞻模块:IM2LATEX-100k 图像到 LaTeX 的 OCR、WMT16 多模态机器翻译和 WMT14 机器翻译。我们的前瞻模块提升了较简单数据集(如 IM2LATEX-100k 和 WMT16 多模态机器翻译)的性能。然而,对更难的数据集(例如包含更长序列)WMT14 机器翻译,提升变得微小。我们使用 k 步前瞻的进一步研究表明,更难的任务受限于被高估的 EOS(句末)概率。我们认为,被高估的 EOS 概率也导致了束搜索在增大束宽时性能下降。我们通过将辅助 EOS 损失整合进训练以估计模型应发出 EOS 还是其他词,来解决 EOS 问题。实验表明,改进 EOS 估计不仅提升了我们所提前瞻模块的性能,也增强了束搜索的鲁棒性。

关键词

引用

@article{arxiv.2003.03716,
  title  = {Investigating the Decoders of Maximum Likelihood Sequence Models: A Look-ahead Approach},
  author = {Yu-Siang Wang and Yen-Ling Kuo and Boris Katz},
  journal= {arXiv preprint arXiv:2003.03716},
  year   = {2020}
}

备注

7 pages, 5 figures