中文

面向数据到文本与文本到数据的多源学习

机器学习 2023-02-23 v1 人工智能 计算与语言 机器学习

摘要

数据到文本(D2T)与文本到数据(T2D)是双重任务,分别将图或表等结构化数据转换为流畅文本,以及反之。这些任务通常被分开处理,并使用从单一来源提取的语料库。当前系统利用在D2T或T2D任务上微调的预训练语言模型。该方法有两个主要局限:首先,必须为每个任务和来源调整一个独立的系统;其次,学习受到可用语料稀缺性的限制。本文考虑了一种更通用的场景,其中数据来自多个异构源。每个源以其特定的数据格式和语义域,提供文本与结构化数据的非平行语料库。我们引入了一种具有解耦风格与内容变量的变分自编码器模型,使我们能够表示由多源文本与数据产生的多样性。我们的模型旨在联合处理D2T与T2D任务。我们在多个数据集上评估了我们的模型,并表明通过从多源学习,我们的模型缩小了与有监督单源对应模型的性能差距,并在某些情况下优于它。

关键词

引用

@article{arxiv.2302.11269,
  title  = {Learning from Multiple Sources for Data-to-Text and Text-to-Data},
  author = {Song Duong and Alberto Lumbreras and Mike Gartrell and Patrick Gallinari},
  journal= {arXiv preprint arXiv:2302.11269},
  year   = {2023}
}

备注

AISTATS 2023