抽取、去噪与强制:文本生成中概念保持的评估与改进
计算与语言
2021-09-06 v2
摘要
先前关于文本到文本生成的研究通常假设模型能够通过序列到序列(seq2seq)学习,仅借助平行训练数据而无额外引导,自行确定在输入中关注什么、在输出中包含什么。然而,当前模型能否保持源输入中的重要概念仍不清楚,因为 seq2seq 学习并未显式关注这些概念,且常用评估指标也将概念与其他词元同等对待。本文提出一项系统性分析,研究当前 seq2seq 模型(尤其是预训练语言模型)在保持重要输入概念方面是否足够好,以及以概念作为词汇约束显式引导生成在多大程度上有益。我们通过在对四种代表性文本到文本生成任务的广泛分析实验中回答上述问题。基于观察,我们进而提出一个简单而有效的框架,自动抽取、去噪并强制将重要输入概念作为词汇约束。这一新方法在自动指标上与无约束对应方法表现相当或更好,展现出更高的概念保持覆盖率,并在人工评估中获得更好评分。我们的代码见 https://github.com/morningmoni/EDE。
引用
@article{arxiv.2104.08724,
title = {Extract, Denoise and Enforce: Evaluating and Improving Concept Preservation for Text-to-Text Generation},
author = {Yuning Mao and Wenchang Ma and Deren Lei and Jiawei Han and Xiang Ren},
journal= {arXiv preprint arXiv:2104.08724},
year = {2021}
}
备注
EMNLP 2021