emrQA-msquad:基于 SQuAD V2.0 框架结构化的医学数据集, enriched with emrQA 医学信息
计算与语言
2024-04-19 v1
摘要
机器阅读理解(Machine Reading Comprehension, MRC)在塑造医学问答系统(Medical Question Answering Systems, QAS)方面发挥着关键作用,正在改变医学信息获取和应用的格局。然而,医学领域固有的挑战,如复杂的术语和问题模糊性, necessitates 创新解决方案。一个关键解决方案是整合专门的医学数据集并创建专门的数据集。这种战略方法提高了 QAS 的准确率,为临床决策和医学研究的进步做出了贡献。为了应对医学术语的复杂性,集成了专门的数据集,以 emrQA 为例,但重新结构化为 163,695 个问题和 4,136 个手动获取的答案,称之为 emrQA-msquad 数据集。此外,针对模糊问题,引入了一个专门用于 Span extraction 任务的医学数据集,强化了系统的鲁棒性。对 BERT、RoBERTa 和 Tiny RoBERTa 等模型进行医学语境下的微调,显著提高了响应准确率,分别在 F1 分数范围内提升至 0.75 到 1.00、18.7% 到 44.7% 和 16.0% 到 46.8%。最后,emrQA-msquad 数据集公开 availability at https://huggingface.co/datasets/Eladio/emrqa-msquad。
引用
@article{arxiv.2404.12050,
title = {emrQA-msquad: A Medical Dataset Structured with the SQuAD V2.0 Framework, Enriched with emrQA Medical Information},
author = {Jimenez Eladio and Hao Wu},
journal= {arXiv preprint arXiv:2404.12050},
year = {2024}
}
备注
The dataset is available in https://huggingface.co/datasets/Eladio/emrqa-msquad