NVDRS Circumstance Extraction 中 LLM 与微调模型在不同提示复杂度下的性能比较
计算与语言
2026-05-22 v1 人工智能
摘要
自杀是美国死亡人数前列的主要原因,理解其前因需要从死亡调查叙述中提取结构化信息。许多情形需要语义推理,超出简单关键词匹配。我们开发了一种“复杂度得分”算法,用于分析编码手册结构,预测详细提示(含完整编码指南)相较于仅含名称的提示何时更有优势。随后我们构建了一种混合方法,按情形选择提示策略。我们在来自全国暴力死亡报告系统 (NVDRS) 的 25 种推理复杂情形上,对大语言模型 (LLM) 与微调 RoBERTa 进行评估。我们发现,LLM 在训练数据不足的低流行情形中显著优于微调模型。我们进一步证明,该框架可推广至前沿 LLM,GPT-5.2、Gemini 2.5 Pro 和 Llama-3 70B 显示出一致的性能模式。这些发现支持一种混合架构:LLM 处理罕见且推理复杂的情形,而微调模型处理常见情形。
引用
@article{arxiv.2605.21845,
title = {Comparing LLM and Fine-Tuned Model Performance on NVDRS Circumstance Extraction with Varying Prompt Complexity},
author = {Geoffrey Martin and Xuan Zhong Feng and Yifan Peng},
journal= {arXiv preprint arXiv:2605.21845},
year = {2026}
}
备注
Accepted at IEEE ICHI 2026