利用信息最大化分层条件 VAE 从上下文中生成多样且一致的问答对
计算与语言
2020-06-16 v5 机器学习
摘要
问答(QA)中最关键挑战之一是标注数据的稀缺,因为通过人工标注为目标文本领域获取问答(QA)对代价高昂。解决该问题的另一种方法是使用从问题上下文或大量非结构化文本(例如 Wikipedia)自动生成的 QA 对。在本工作中,我们提出了一种分层条件变分自编码器(HCVAE),用于在给定非结构化文本作为上下文时生成 QA 对,同时最大化所生成 QA 对之间的互信息以确保其一致性。我们在多个基准数据集上验证了我们的信息最大化分层条件变分自编码器(Info-HCVAE),通过仅使用生成的 QA 对(基于 QA 的评估)或同时使用生成的和人工标注的 QA 对(半监督学习)训练来评估 QA 模型(BERT-base)的性能,并与最先进的基线模型进行比较。结果表明,我们的模型在两项任务上均仅使用一小部分训练数据便取得了优于所有基线的显著性能提升。
引用
@article{arxiv.2005.13837,
title = {Generating Diverse and Consistent QA pairs from Contexts with Information-Maximizing Hierarchical Conditional VAEs},
author = {Dong Bok Lee and Seanie Lee and Woo Tae Jeong and Donghwan Kim and Sung Ju Hwang},
journal= {arXiv preprint arXiv:2005.13837},
year = {2020}
}
备注
ACL 2020