中文

从文本时间序列预测临床风险:为医学中的时序AI构建叙事结构

计算与语言 2025-12-30 v5 人工智能

摘要

临床病例报告编码了往往被传统依赖结构化数据的机器学习方法所忽略的患者时间轨迹。本文引入从文本时间序列进行预测的问题,其中时间戳临床发现——通过LLM辅助标注管道提取——作为主要输入用于预测。我们系统评估了多样化的模型集合,包括微调的基于解码器的大语言模型和基于编码器的变换器,针对事件发生预测、时间顺序和生存分析等任务进行实验。我们的实验表明,基于编码器的模型在短期和长期事件预测中持续获得更高的F1分数和更优的时序一致性,而微调的掩码方法可提升排序性能。相比之下,指令调校的解码器模型在生存分析中显示出相对优势,尤其在早期预后情境下。我们的灵敏度分析进一步表明,时间顺序的重要性需要临床时间序列构建,而与此相对的是文本顺序——LLMs通常训练的文本输入格式。这凸显了以时间排序语料库可获得的额外好处,对于在LLM广泛应用时代的时序任务具有深远含义。

关键词

引用

@article{arxiv.2504.10340,
  title  = {Forecasting Clinical Risk from Textual Time Series: Structuring Narratives for Temporal AI in Healthcare},
  author = {Shahriar Noroozizadeh and Sayantan Kumar and Jeremy C. Weiss},
  journal= {arXiv preprint arXiv:2504.10340},
  year   = {2025}
}

备注

AAAI AI for Social Impact 2026. Shahriar Noroozizadeh, Sayantan Kumar (authors contributed equally)