通过生成类 NQ 问题改进问答系统
计算与语言
2022-10-14 v1
摘要
问答(QA)系统需要大量标注数据,而收集这些数据成本高且耗时。由于格式和复杂性的差异,转换现有 QA 基准的数据集具有挑战性。为解决这些问题,我们提出一种算法,通过利用数据集间的风格转换,从 Quizbowl(QB)数据集中的较长冷知识问题自动生成类似日常人类交流的、更短的问题,即 Natural Questions(NQ)数据集中的问题。这提供了一种自动为我们的 QA 系统生成更多数据的方法。为确保数据的数量与质量,我们使用神经分类器检测并移除格式错误的问题。我们证明,在低资源设置下,使用生成的数据在 NQ 和 QB 数据上均优于基线系统的 QA 性能。我们的算法在保持 QA 系统数据质量的同时提高了训练数据的可扩展性。
引用
@article{arxiv.2210.06599,
title = {Improving Question Answering with Generation of NQ-like Questions},
author = {Saptarashmi Bandyopadhyay and Shraman Pal and Hao Zou and Abhranil Chandra and Jordan Boyd-Graber},
journal= {arXiv preprint arXiv:2210.06599},
year = {2022}
}