基于统一编码器-解码器架构的复杂电子健康记录数据库问答
计算与语言
2021-11-30 v1 人工智能
机器学习
摘要
能够基于电子健康记录回答人类问题的智能机器(EHR-QA)具有重要的实用价值,例如支持临床决策、管理医院行政和医疗聊天机器人。先前基于表的 QA 研究聚焦于将自然语言问题翻译为表查询(NLQ2SQL),然而由于 EHR 数据复杂且专业的医学术语特性,其解码难度增加。本文中,我们设计了 UniQA,一种用于 EHR-QA 的统一编码器-解码器架构,将自然语言问题转换为 SQL 或 SPARQL 等查询。我们还提出了输入掩码(IM),一种简单有效的方法,以应对复杂医学术语与各种拼写错误,并更好地学习 SQL/SPARQL 语法。将统一架构与有效的辅助训练目标结合,UniQA 相较于先前最先进模型在 MIMICSQL*(EHR 领域最复杂的 NLQ2SQL 数据集)上取得了显著性能提升(14.2% 增益),在其充满拼写错误的版本上约提升 28.8%。此外,我们在基于图的 EHR-QA 数据集 MIMICSPARQL* 上确认了一致的结果。
引用
@article{arxiv.2111.14703,
title = {Question Answering for Complex Electronic Health Records Database using Unified Encoder-Decoder Architecture},
author = {Seongsu Bae and Daeyoung Kim and Jiho Kim and Edward Choi},
journal= {arXiv preprint arXiv:2111.14703},
year = {2021}
}
备注
Proc. of Machine Learning for Health (ML4H) 2021 (Oral Spotlight)