具有增强数据质量保证的众包:缓解医疗领域大型语言模型训练中资源稀缺挑战的高效方法
计算与语言
2024-05-24 v1 人工智能
摘要
大型语言模型(LLM)在包括医疗保健在内的各个领域的人工智能中展现了巨大潜力。然而,其有效性受到对高质量标注数据需求的阻碍,这些数据的创建通常昂贵且耗时,尤其是在医疗保健等低资源领域。为了应对这些挑战,我们提出了一种在数据收集前、实时和收集后阶段均富含质量控制措施的众包(CS)框架。我们的研究评估了通过其对 LLM(Bio-BERT)在预测自闭症相关症状中的影响来增强数据质量的有效性。结果表明,与收集前质量控制相比,实时质量控制将数据质量提高了 19%。与 Bio-BERT 基线相比,使用众包数据微调 Bio-BERT 通常提高了召回率,但降低了精确率。我们的发现突出了众包和质量控制在资源受限环境中的潜力,并为优化医疗 LLM 以支持知情决策和改善患者护理提供了见解。
引用
@article{arxiv.2405.13030,
title = {Crowdsourcing with Enhanced Data Quality Assurance: An Efficient Approach to Mitigate Resource Scarcity Challenges in Training Large Language Models for Healthcare},
author = {P. Barai and G. Leroy and P. Bisht and J. M. Rothman and S. Lee and J. Andrews and S. A. Rice and A. Ahmed},
journal= {arXiv preprint arXiv:2405.13030},
year = {2024}
}
备注
Published in AMIA Summit, Boston, 2024. https://knowledge.amia.org/Info2024/pdf/Info2024a022/Info2024fl021