中文

通过自然语言查询可视化电子医疗记录的探索之路

数据库 2025-06-17 v1

摘要

电子医疗记录 (EMR) 包含患者护理和临床研究所必需的数据。尽管 EHR 中结构化和非结构化数据的多样性,数据可视化仍是管理和解释这些复杂性的宝贵工具。然而,相关医学可视化数据的稀缺以及开发此类数据集所需的高昂手动标注成本,构成了推动医学可视化技术发展的重大挑战。为此,我们提出一种创新方法,利用大型语言模型 (LLM) 进行无需耗时的手动标注来生成可视化数据。我们引入了适用于 EMR 的文本到可视化基准数据集构建管道,使用户能够通过自然语言查询 (NLQ) 可视化 EMR 统计信息。本文所呈现的数据集主要由成对的文本医疗记录、NLQ 以及相应可视化组成,构成了首个规模为 35,374 例的用于电子医疗记录信息的文本到可视化数据集,名为 MedicalVis。此外,我们引入一种基于 LLM 的方法称为 MedCodeT5,展示了其在从 NLQ 生成 EMR 可视化方面的可行性,优于各种强大的文本到可视化基准方法。我们的工作既促进了 EMR 可视化方法的标准化评估,又为研究人员提供了工具以推动这一有影响力的应用领域的发展。总之,本研究和数据集有望推动通过可视化发掘医学洞见的进展。

关键词

引用

@article{arxiv.2506.12837,
  title  = {Towards Visualizing Electronic Medical Records via Natural Language Queries},
  author = {Haodi Zhang and Siqi Ning and Qiyong Zheng and Jinyin Nie and Liangjie Zhang and Weicheng Wang and Yuanfeng Song},
  journal= {arXiv preprint arXiv:2506.12837},
  year   = {2025}
}