中文

基于检索-分类的临床价值集编撰自动化

计算与语言 2026-04-17 v1 人工智能 机器学习

摘要

临床价值集编撰——即识别标准化词汇表中定义临床概念的所有代码——是临床质量测量和表型学中的一个常见瓶颈。自然的做法是提示大型语言模型 (LLM) 直接生成所需代码,但结构化临床词汇表规模庞大、受版本控制,且在预训练期间未被可靠地记忆。我们提出了检索增强集合完成 (RASC):从精选语料库中检索最相似的现有价值集以形成候选池,然后对每个候选代码应用分类器。从理论上讲,检索-选择可通过缩小有效输出空间从完整词汇表缩小到更小的检索候选池来降低统计复杂性。我们在 11,803 个公开可用的 VSAC 价值集上展示了 RASC 的实用性,构建了该任务的第一个大规模基准。一个在 SAPBert 上微调的 cross-encoder 实现 AUROC~0.852 和价值集水平 F1~0.298,超过更简单的三层感知机 (AUROC~0.799, F1~0.250),且将每个真实阳性对应的无关候选数从 12.3 (仅检索) 降低到约 3.2 和 4.4。零-shot GPT-4o 实现的价值集水平 F1~0.105,48.6% 返回的代码在 VSAC 中根本不存在。随着价值集大小的增加,这种性能差距扩大,符合 RASC 的理论优势。我们观察到类似的性能提升在另两种分类器模型类型上也能实现,分别是基于预训练 SAPBert 初始化的 cross-encoder 和 LightGBM 模型,表明 RASC 的优势不局限于单一模型类别。用于下载和创建基准数据集以及模型训练代码的源码可在 \href{https://github.com/mukhes3/RASC}{https://github.com/mukhes3/RASC} 上获得。

关键词

引用

@article{arxiv.2604.14616,
  title  = {Retrieve, Then Classify: Corpus-Grounded Automation of Clinical Value Set Authoring},
  author = {Sumit Mukherjee and Juan Shu and Nairwita Mazumder and Tate Kernell and Celena Wheeler and Shannon Hastings and Chris Sidey-Gibbons},
  journal= {arXiv preprint arXiv:2604.14616},
  year   = {2026}
}