勿拘字面:一种用于文本生成的编辑不变序列损失
计算与语言
2022-05-10 v7 人工智能
摘要
神经文本生成模型通常通过对数似然最大化与序列交叉熵(CE)损失进行训练,其鼓励目标序列与生成序列之间逐 token 的精确匹配。当目标序列不完美时,例如目标序列被噪声损坏,或仅有弱序列监督可用时,此类训练目标为次优。为应对该挑战,我们提出一种新颖的编辑不变序列损失(EISL),其计算目标 n-gram 与生成序列中所有 n-gram 的匹配损失。EISL 被设计为对目标序列中的各种噪声与编辑具有鲁棒性。此外,EISL 计算本质上是一种以目标 n-gram 为核的近似卷积操作,易于实现并可利用现有库高效计算。为展示 EISL 的有效性,我们在广泛任务上进行了实验,包括带噪声目标序列的机器翻译、仅有弱训练信号的无监督文本风格迁移,以及具有非预定义生成顺序的非自回归生成。实验结果表明,我们的方法在所有任务上显著优于常见 CE 损失与其他强基线。EISL 具有简单 API,可作为 CE 损失的即插即用替代:https://github.com/guangyliu/EISL。
引用
@article{arxiv.2106.15078,
title = {Don't Take It Literally: An Edit-Invariant Sequence Loss for Text Generation},
author = {Guangyi Liu and Zichao Yang and Tianhua Tao and Xiaodan Liang and Junwei Bao and Zhen Li and Xiaodong He and Shuguang Cui and Zhiting Hu},
journal= {arXiv preprint arXiv:2106.15078},
year = {2022}
}
备注
Camera ready, 2022 NAACL main conference