中文

通过联合学习词元抽取与文本生成增强不完整话语还原

计算与语言 2022-08-01 v3 人工智能

摘要

本文介绍了一种用于不完整话语还原(IUR)的模型,称为 JET(\textbf{J}oint learning token \textbf{E}xtraction and \textbf{T}ext generation,联合学习词元抽取与文本生成)。与以往仅适用于抽取式或抽象式数据集的研究不同,我们设计了一个简单而有效的模型,可同时适用于 IUR 的两种场景。我们的设计模拟了 IUR 的本质,即从上下文中省略的词元有助于还原。据此,我们构建了一个 Picker 来识别被省略的词元。为支持 Picker,我们设计了两种标签创建方法(软标签和硬标签),可在省略词元无标注数据的情况下工作。还原过程由 Generator 在 Picker 的辅助下通过联合学习完成。在抽取式和抽象式场景的四个基准数据集上的结果表明,在丰富和有限训练数据设置下,我们的模型均优于预训练的 T5 和非生成式语言模型方法。\footnote{代码见 \url{https://github.com/shumpei19/JET}}

关键词

引用

@article{arxiv.2204.03958,
  title  = {Enhance Incomplete Utterance Restoration by Joint Learning Token Extraction and Text Generation},
  author = {Shumpei Inoue and Tsungwei Liu and Nguyen Hong Son and Minh-Tien Nguyen},
  journal= {arXiv preprint arXiv:2204.03958},
  year   = {2022}
}

备注

This paper was accepted by 2022 Annual Conference of the North American Chapter of the Association for Computational Linguistics (NAACL 2022). It includes 10 pages, 2 figures