社会科学与人文科学中参考文献抽取与解析的大型语言模型基准测试
摘要
文献参考文献抽取与解析是引用索引、链接以及下游学术知识图谱构建的基础。然而,大多数既定评估聚焦于干净、英文、文档末端的参考文献,因此未能代表社会科学与人文科学(SSH),在这些领域中,引用常常是多语言的、嵌入脚注中的、被简写的,并且受制于异质的历史惯例。我们提出一个统一的基准,针对这些 SSH 实际情景,涵盖三个互补数据集:CEX(跨学科英文期刊文章)、EXCITE(德语/英文文档,包含章节末、脚注专属和混合 regimes)以及 LinkedBooks(人文科学参考文献,具有强烈的风格变异和多语言性)。我们评估三个递增难度的任务——参考文献抽取、参考文献解析和端到端文档解析——在 schema 受限的设置下,以便在强监督管线基线(GROBID)和当代大型语言模型(DeepSeek-V3.1、Mistral-Small-3.2-24B、Gemma-3-27B-it 和 Qwen3-VL(4B-32B 变体))之间进行直接比较。在数据集上,抽取任务在中等能力阈值以上基本饱和,而解析和端到端解析仍是主要瓶颈,由于在噪声布局下结构化输出脆弱。我们进一步展示了轻量级 LoRA 适配器可实现持续性提升——尤其在 SSH 重数据集上——且分段/管道化可显著提升鲁棒性。最后,我们主张通过路由实现混合部署:对结构良好、分布内的 PDF 使用 GROBID,而将多语言和脚注密集文档提升到任务适应的 LLM。
引用
@article{arxiv.2603.13651,
title = {Benchmarking Large Language Models on Reference Extraction and Parsing in the Social Sciences and Humanities},
author = {Yurui Zhu and Giovanni Colavizza and Matteo Romanello},
journal= {arXiv preprint arXiv:2603.13651},
year = {2026}
}
备注
12 pages, 2 figures. Accepted at the SCOLIA 2026 Workshop (Second Workshop on Scholarly Information Access), co-located with ECIR 2026. Workshop date: April 2, 2026