利用数据增强与过度生成排序改进阅读理解问题生成
计算与语言
2023-06-16 v1 计算机与社会
机器学习
摘要
阅读理解在教育的诸多方面都是一项关键技能,包括语言学习、认知发展以及培养儿童的早期读写能力。自动化的答案感知型阅读理解问题生成在扩展教育活动中学习者支持方面具有显著潜力。此场景下的一个关键技术挑战是,针对同一答案可能存在多个问题,有时彼此差异很大;训练好的问题生成方法未必知道人类教育者更偏好哪个问题。为应对这一挑战,我们提出 1) 一种数据增强方法,在给定相同上下文和答案的情况下用多样化问题丰富训练数据集,以及 2) 一种过度生成与排序(overgenerate-and-rank)方法,从候选问题池中筛选最佳问题。我们在 FairytaleQA 数据集上评估了我们的方法,在 ROUGE-L 上比现有最佳方法绝对提升 5%。我们还展示了我们的方法在生成更难的“隐式”问题(即答案不以文本片段形式包含在上下文中)方面的有效性。
引用
@article{arxiv.2306.08847,
title = {Improving Reading Comprehension Question Generation with Data Augmentation and Overgenerate-and-rank},
author = {Nischal Ashok Kumar and Nigel Fernandez and Zichao Wang and Andrew Lan},
journal= {arXiv preprint arXiv:2306.08847},
year = {2023}
}
备注
Oral presentation at ACL BEA workshop 2023. Code available at: https://github.com/umass-ml4ed/question-gen-aug-ranking