面向临床笔记开放属性值提取的小型语言模型结构化输出鲁棒性评估
计算与语言
2025-08-06 v1 信息检索
摘要
我们对比分析了小型语言模型生成的结构化输出在从临床笔记中进行开放属性值提取时的可解析性。我们评估了三种广泛使用的序列化格式:JSON、YAML和XML,发现JSON始终能获得最高的可解析性。结构鲁棒性随目标化提示和更大模型而改善,但在更长的文档和特定笔记类型下会下降。我们的错误分析识别出了格式特定的重复失效模式。这些发现为在隐私敏感的临床环境中选择序列化格式和设计提示提供了实用指导。
引用
@article{arxiv.2507.01810,
title = {Evaluating Structured Output Robustness of Small Language Models for Open Attribute-Value Extraction from Clinical Notes},
author = {Nikita Neveditsin and Pawan Lingras and Vijay Mago},
journal= {arXiv preprint arXiv:2507.01810},
year = {2025}
}
备注
To appear in the ACL Anthology