CycleGT:基于循环训练的无监督图到文本与文本到图生成
计算与语言
2020-12-11 v3 人工智能
机器学习
摘要
知识图谱与自然语言处理交叉领域的两个重要任务是图到文本(G2T)与文本到图(T2G)转换。由于数据收集困难且成本高昂,这两个领域可用的监督数据通常仅在一万量级,例如预处理后的 WebNLG~2017 数据集为 18K,远少于机器翻译等其他任务的数百万数据。因此,用于 G2T 和 T2G 的深度学习模型深受训练数据稀缺的困扰。我们提出 CycleGT,一种从无标注的非平行图与文本数据出发、并在两种形式间迭代回译的无监督训练方法。在 WebNLG 数据集上的实验表明,我们的无监督模型在使用相同数据量训练时,性能与多个全监督模型相当。在非平行 GenWiki 数据集上的进一步实验验证,我们的方法在无监督基线中表现最佳。这验证了我们的框架是克服 G2T 和 T2G 领域数据稀缺问题的有效途径。我们的代码已发布于 https://github.com/QipengGuo/CycleGT。
引用
@article{arxiv.2006.04702,
title = {CycleGT: Unsupervised Graph-to-Text and Text-to-Graph Generation via Cycle Training},
author = {Qipeng Guo and Zhijing Jin and Xipeng Qiu and Weinan Zhang and David Wipf and Zheng Zhang},
journal= {arXiv preprint arXiv:2006.04702},
year = {2020}
}
备注
INLG 2020 Workshop