分词一致性对生成模型在抽取式 NLP 任务上的表现至关重要
计算与语言
2023-10-26 v2
摘要
生成模型已被广泛应用于解决抽取式任务,即抽取输入的部分内容以构成所需输出,并取得了显著成功。例如,在抽取式问答(QA)中,生成模型持续产出最先进的结果。在本工作中,我们指出了在这些模型训练中被普遍忽视的分词不一致问题。该问题在分词器对输入与输出进行不一致切分后,损害了此类任务的抽取性质,从而导致性能下降以及幻觉现象。我们提出了一种简单而有效的修复方法,并以抽取式 QA 为案例进行研究。我们表明,在一致分词下,模型在域内与域外数据集上均表现更优,当 BART 模型在 SQuAD 上训练并在 8 个 QA 数据集上评测时,获得了平均显著的 +1.7 F2 提升。此外,模型收敛更快,且更不易生成脱离上下文的答案。基于这些发现,我们希望呼吁在解决抽取式任务时更多关注应如何进行分词,并建议在训练期间采用一致分词。
引用
@article{arxiv.2212.09912,
title = {Tokenization Consistency Matters for Generative Models on Extractive NLP Tasks},
author = {Kaiser Sun and Peng Qi and Yuhao Zhang and Lan Liu and William Yang Wang and Zhiheng Huang},
journal= {arXiv preprint arXiv:2212.09912},
year = {2023}
}
备注
Findings of EMNLP2023