中文

数据到文本生成中基于自记忆的自训练

计算与语言 2024-01-22 v1

摘要

本文介绍了一种新颖的训练模型,即数据到文本生成(DTG)中基于自记忆的自训练(STSM),允许模型在子集上进行自训练,这些子集包括作为直接从已训练模型和/或新数据推断出的输出的自记忆。自记忆的质量由两个模型——数据到文本(D2T)和文本到数据(T2D)——通过两个预定义条件进行验证:(1)D2T 模型的输出中出现所有源值;(2)T2D 模型的输出具有转换回源数据的能力。如果较短的 D2T 输出包含所有源值,我们利用贪心算法生成这些较短的输出。随后,我们使用 T2D 模型,通过证明其将文本转换回数据的能力,来确认这些输出能够捕获输入关系。仅使用 30% 的数据集,我们就可以训练出与在相同设置下完全训练具有竞争力性能的 D2T 模型。我们在两个数据集 E2E NLG 和 DART 上对我们的模型进行了实验。STSM 为 D2T 模型提供了来自其子集记忆的泛化能力,同时减少了训练数据量。最终,我们期望本文能为适应新训练数据的持续学习解决方案做出贡献,将其作为 DTG 任务中自记忆的一种形式。精心整理的数据集公开于:https://github.com/hoangthangta/STSM。

关键词

引用

@article{arxiv.2401.10567,
  title  = {Self-training from Self-memory in Data-to-text Generation},
  author = {Hoang-Thang Ta},
  journal= {arXiv preprint arXiv:2401.10567},
  year   = {2024}
}

备注

14 pages