面向半结构化文本的可加大语言模型
计算与语言
2025-11-18 v1 机器学习
摘要
大型语言模型在临床文本分类方面取得了进展,但其不透明的预测仍是实际应用中(尤其是研究人员和医生需要理解患者记录中哪些部分驱动风险信号的场景)的关键障碍。为此,我们引入了 CALM,即 Classification with Additive Large Language Models 的缩写,这是一个针对半结构化文本的可解释框架。输入由语义上有意义的组成部分构成,如住院记录的各个章节或摄取表格中的问答字段。CALM 将预测结果作为每个组成部分贡献之和进行计算,使这些贡献成为前向计算的一部分,从而在患者层面和总体层面上实现可靠解释。可加结构还支持清晰的可视化效果,例如类似广义可加模型中使用的组成部分风险曲线,使所学关系更容易检查和沟通。虽然 CALM 期望输入为半结构化形式,但许多临床文档已具备此类结构,类似结构也常可从自由文本记录中自动提取。CALM 在保持常规 LLM 分类器性能的同时,提升了可信度,支持质量保证检查,并在模型开发和审计期间揭示临床上有意义的模式。
引用
@article{arxiv.2511.11922,
title = {Additive Large Language Models for Semi-Structured Text},
author = {Karthikeyan K and Raghuveer Thirukovalluru and David Carlson},
journal= {arXiv preprint arXiv:2511.11922},
year = {2025}
}