中文

LLM StructCore:模式引导的推理压缩与确定性编译

计算与语言 2026-04-23 v1

摘要

从临床笔记自动填写病例报告表(CRFs)具有挑战性,原因在于语言噪声、严格的输出约束以及误报的高昂代价。我们描述了为 CL4Health 2026 提交的呼吸困难 CRF 填写(134 项)方案,该方案采用基于模式引导推理(SGR)的契约驱动两阶段设计。关键的任务特性是极端稀疏性:大多数字段未知,并且官方评分会惩罚空值和未经支持的预测。我们从单步“LLM 预测 134 个字段”的方法转变为一种分解方法,其中(i)第一阶段生成一个稳定的 SGR 风格 JSON 摘要,恰好包含 9 个领域键,以及(ii)第二阶段是一个完全确定性、零 LLM 的编译器,它解析第一阶段摘要,规范化项目名称,将预测标准化为官方受控词汇表,应用证据门控的假阳性过滤器,并将输出扩展为所需的 134 项格式。在 dev80 划分上,最佳教师配置实现了宏观 F1 值 0.6543(英文)和 0.6905(意大利文);在隐藏的 test200 上,提交的英文变体在 Codabench 上得分为 0.63。该流程与语言无关:意大利语的结果与英语相当或更优,且无需任何特定语言的工程。

关键词

引用

@article{arxiv.2604.20560,
  title  = {LLM StructCore: Schema-Guided Reasoning Condensation and Deterministic Compilation},
  author = {Serhii Zabolotnii},
  journal= {arXiv preprint arXiv:2604.20560},
  year   = {2026}
}

备注

16 pages, 1 figure, 5 tables. Preprint of a paper accepted to the Third Workshop on Patient-oriented Language Processing (CL4Health), co-located with LREC-COLING 2026