LIQUID:一种列表问答数据集生成框架
计算与语言
2023-02-07 v2
摘要
问答(QA)模型常依赖大规模训练数据集,因而有必要开发数据生成框架以降低人工标注成本。尽管近期若干研究旨在生成具有单跨度答案的合成问题,尚无研究涉及以多个非连续跨度为答案的列表问题创建。为弥补此缺口,我们提出 LIQUID,一种从非标注语料自动生成列表 QA 数据集的框架。我们首先将来自 Wikipedia 或 PubMed 的段落转换为摘要,并从摘要文本中提取命名实体作为候选答案。这使我们能选取在上下文中语义相关的答案,从而适于构建列表问题。随后,我们利用现成的问答生成器,基于所提取实体与原始段落创建问题。最后,执行迭代过滤与答案扩展以确保答案的准确性与完整性。使用我们的合成数据,我们在 MultiSpanQA 上以精确匹配 F1 分数提升 5.0、在 Quoref 上提升 1.9、在三项 BioASQ 基准上平均提升 2.8,显著改进了此前最佳列表 QA 模型的性能。
引用
@article{arxiv.2302.01691,
title = {LIQUID: A Framework for List Question Answering Dataset Generation},
author = {Seongyun Lee and Hyunjae Kim and Jaewoo Kang},
journal= {arXiv preprint arXiv:2302.01691},
year = {2023}
}
备注
AAAI 2023