TLDR:用于减少重复话语生成的词元损失动态重加权
计算与语言
2020-04-10 v2
摘要
自然语言生成(NLG)模型易于生成重复话语。本工作中,我们研究编码器-解码器模型的重复问题,使用循环神经网络(RNN)与 transformer 两种架构。为此,我们考虑闲聊任务,其中该问题比其它需要编码器-解码器架构的任务更为突出。我们首先研究模型架构的影响。通过对 RNN 使用预注意力与高速连接,我们得以实现更低的重复率。然而,该方法不能推广到如 transformer 等其它模型。我们假设更深层次的原因在于:训练语料中存在比其它词元更难被生成模型学习的困难词元,且一旦学习结束,困难词元仍学习不足,从而更可能发生重复生成。基于该假设,我们提出词元损失动态重加权(TLDR),对单个词元损失施加可微分权重。通过对困难词元使用更高权重、对简单词元使用更低权重,NLG 模型能够以不同步调学习各个词元。在闲聊基准数据集上的实验表明,相较于使用不同加权函数的基线,TLDR 对 RNN 与 transformer 架构在重复减少上均更为有效。
引用
@article{arxiv.2003.11963,
title = {TLDR: Token Loss Dynamic Reweighting for Reducing Repetitive Utterance Generation},
author = {Shaojie Jiang and Thomas Wolf and Christof Monz and Maarten de Rijke},
journal= {arXiv preprint arXiv:2003.11963},
year = {2020}
}
备注
9 pages, 4 figures, 1 table