中文

面向自动问题生成的跨语言训练

计算与语言 2019-06-07 v1

摘要

自动问题生成(QG)是自然语言理解中一个具有挑战性的问题。QG 系统的构建通常假设可获取大量训练实例,其中每个实例为一个问题及其对应答案。对于一门新语言,此类训练实例难以获取,使得 QG 问题更具挑战性。基于此动机,我们研究了复用一门辅助语言(如英语)中可用的海量 QG 数据集,来为感兴趣的目标语言(如印地语)学习 QG 模型。对于目标语言,我们假设可获取大量单语文本但仅有小规模 QG 数据集。我们提出了一种跨语言 QG 模型,其采用如下训练机制:(i)在目标语言与辅助语言中无监督预训练语言模型;(ii)两种语言下针对 QG 的联合有监督训练。我们使用印地语和汉语两种不同的目标语言证明了所提方法的有效性。我们还创建并发布了一个包含 6555 个句子的印地语问答新数据集。

关键词

引用

@article{arxiv.1906.02525,
  title  = {Cross-Lingual Training for Automatic Question Generation},
  author = {Vishwajeet Kumar and Nitish Joshi and Arijit Mukherjee and Ganesh Ramakrishnan and Preethi Jyothi},
  journal= {arXiv preprint arXiv:1906.02525},
  year   = {2019}
}

备注

ACL 2019