中文

显式与隐式传记:在维基数据派生文本上评估与适配LLM信息抽取

计算与语言 2025-09-19 v1

摘要

文本的隐式性一直是自然语言处理(NLP)中的难题,传统方法依赖显式陈述来识别实体及其关系。例如,从"Zuhdi每周日去教堂"这句话中,Zuhdi与基督教的关系对人类读者而言是显而易见的,但在自动推断时却具有挑战性。大型语言模型(LLM)在NLP下游任务中,如文本理解和信息抽取(IE)方面已证明有效。本研究考察了文本隐式性对预训练LLM(LLaMA 2.3、DeepSeekV1和Phi1.5)在信息抽取任务中的影响:我们生成了两套包含1万条隐式和显式叙述的合成数据集,以衡量LLM性能,并分析细化隐式数据后其在隐式推理任务中的泛化能力。该研究对LLM在信息抽取中的内部推理过程进行了实验探讨,尤其是处理隐式与显式语境方面。结果表明,采用LoRA(低秩适配)对LLM模型进行细化,可显著提升其从隐式文本中抽取信息的能力,进而增强模型的可解释性和可靠性。

关键词

引用

@article{arxiv.2509.14943,
  title  = {Explicit vs. Implicit Biographies: Evaluating and Adapting LLM Information Extraction on Wikidata-Derived Texts},
  author = {Alessandra Stramiglio and Andrea Schimmenti and Valentina Pasqual and Marieke van Erp and Francesco Sovrano and Fabio Vitali},
  journal= {arXiv preprint arXiv:2509.14943},
  year   = {2025}
}