LG AI Research & KAIST 在 EHRSQL 2024 中的工作:利用伪标记的不可回答问题对大语言模型进行自训练,构建可靠的电子健康记录文本到SQL系统
计算与语言
2024-05-21 v1
摘要
文本到SQL模型对于让没有SQL知识的医疗保健专业人员能够访问电子健康记录(EHR)至关重要。随着大语言模型的进步,这些系统在将复杂问题转换为SQL查询方面变得更加熟练。然而,医疗保健领域对可靠性的关键需求要求这些模型能够准确识别不可回答的问题或不确定的预测,从而防止错误信息。为了解决这个问题,我们提出了一种自训练策略,使用伪标记的不可回答问题来增强用于EHR的文本到SQL模型的可靠性。该方法包括一个两阶段训练过程,随后是基于令牌熵和查询执行的过滤方法。我们在EHRSQL 2024共享任务中的最佳表现验证了我们方法的有效性,展示了通过更可靠的文本到SQL系统改善医疗决策的潜力。
引用
@article{arxiv.2405.11162,
title = {LG AI Research & KAIST at EHRSQL 2024: Self-Training Large Language Models with Pseudo-Labeled Unanswerable Questions for a Reliable Text-to-SQL System on EHRs},
author = {Yongrae Jo and Seongyun Lee and Minju Seo and Sung Ju Hwang and Moontae Lee},
journal= {arXiv preprint arXiv:2405.11162},
year = {2024}
}
备注
NAACL 2024 Clinical NLP Workshop