一种用于改进领域特定机器阅读理解数据集的数据中心框架
计算与语言
2023-10-13 v2
摘要
低质量数据会在高风险应用中引发下游问题。数据中心方法强调通过提升数据集质量来增强模型性能。通用大语言模型(Large Language Models, LLMs)的训练以及领域特定模型(通常规模较小,因为聘请大量领域专家创建成本高昂)都需要高质量数据集。因此,确保高质量的领域特定训练数据至关重要。本文提出一种提升原始数据集数据质量的框架。我们将该框架应用于四个生物医学数据集,并在 BioASQ 数据集上通过使用回译提升原始数据集质量,对检索/阅读模型进行微调时显示出最高达 33%/40% 的相对提升。
引用
@article{arxiv.2304.00483,
title = {A Data-centric Framework for Improving Domain-specific Machine Reading Comprehension Datasets},
author = {Iva Bojic and Josef Halim and Verena Suharman and Sreeja Tar and Qi Chwen Ong and Duy Phung and Mathieu Ravaut and Shafiq Joty and Josip Car},
journal= {arXiv preprint arXiv:2304.00483},
year = {2023}
}