面向自然语言生成的增量式束搜索操纵
计算与语言
2021-03-18 v3
摘要
自然语言生成系统的性能随着现代神经网络的使用得到了显著提升。在测试时,它们通常采用束搜索(beam search)以避免局部最优但全局次优的预测。然而,由于模型误差,根据评测指标,更大的束宽可能导致性能下降。因此,常见的做法是对束搜索的输出进行重排序,但这依赖于束搜索产生一组良好的假设,限制了潜在的收益。其他替代束搜索的方法需要对模型训练进行改动,这相比束搜索限制了其适用性。本文提出增量式束搜索操纵,即在解码过程中而非仅在结束时对束中的假设进行重排序。这样,不太可能得到良好最终输出的假设被丢弃,取而代之的是原本会被忽略的假设将被考虑。应用增量式束搜索操纵在 E2E 和 WebNLG 挑战的测试集上分别比原始束搜索提升了 1.93 和 5.82 个 BLEU 点。所提方法在 E2E 挑战上还以 1.04 个 BLEU 点优于一个强重排序器,同时在 WebNLG 数据集上与之相当。
引用
@article{arxiv.2102.02574,
title = {Incremental Beam Manipulation for Natural Language Generation},
author = {James Hargreaves and Andreas Vlachos and Guy Emerson},
journal= {arXiv preprint arXiv:2102.02574},
year = {2021}
}
备注
camera ready for EACL 2021