中文

PVminerLLM:利用大型语言模型从患者生成文本中结构化提取患者声音

计算与语言 2026-03-09 v1 人工智能

摘要

动机:患者生成的文本包含关于患者生活经历、社会状况和护理参与的关键信息,包括强烈影响依从性、护理协调和健康公平的因素。然而,这些患者声音信号很少以结构化形式存在,限制了它们在以患者为中心的结果研究和临床质量改进中的应用。因此,可靠地提取此类信息对于大规模理解和解决健康的非临床驱动因素至关重要。结果:我们引入了PVminer,一个用于结构化提取患者声音的基准,并提出了PVminerLLM,一个为此任务定制的监督微调大型语言模型。在多个数据集和模型规模上,PVminerLLM显著优于基于提示的基线方法,在代码预测上达到83.82%的F1分数,在子代码预测上达到80.74%的F1分数,在证据跨度提取上达到87.03%的F1分数。值得注意的是,即使使用较小的模型也能实现强劲的性能,这表明无需极端的模型规模即可实现可靠的患者声音提取。这些结果使得能够对嵌入在患者生成文本中的社会和体验信号进行可扩展分析。可用性和实现:代码、评估脚本和训练好的LLM将公开发布。带注释的数据集将根据请求提供给研究使用。关键词:大型语言模型,监督微调,医学标注,患者生成文本,临床自然语言处理

关键词

引用

@article{arxiv.2603.05776,
  title  = {PVminerLLM: Structured Extraction of Patient Voice from Patient-Generated Text using Large Language Models},
  author = {Samah Fodeh and Linhai Ma and Ganesh Puthiaraju and Srivani Talakokkul and Afshan Khan and Ashley Hagaman and Sarah Lowe and Aimee Roundtree},
  journal= {arXiv preprint arXiv:2603.05776},
  year   = {2026}
}