中文

评估微调LLM在AMR解析中的表现

计算与语言 2025-08-19 v3 人工智能

摘要

AMR(Abstract Meaning Representation)是一种语义 formalism,将句子意义编码为以节点表示概念、边表示语义关系的根指向无环图。对仅解码器的大语言模型(LLM)进行微调代表了一种具有前景的新颖方法,用于AMR解析。本文对四种不同的LLM架构进行了全面评估,包括Phi 3.5、Gemma 2、LLaMA 3.2和DeepSeek R1 LLaMA Distilled,测试集使用LDC2020T02金标准AMR3.0测试集。我们的结果表明,对仅解码器的LLM进行直接微调可实现与复杂最先进技术(SOTA)AMR解析器相当的性能。值得注意的是,LLaMA 3.2通过一种直截的微调方法表现出竞争力,能够与SOTA AMR解析器匹争。我们在LDC2020T02完整测试分割上实现了SMATCH F1: 0.804,与APT + 银(IBM)的0.804持平,接近Graphene Smatch(MBSE)的0.854。在我们的分析中,我们还观察到一种一致模式:LLaMA 3.2在语义性能方面领先,而Phi 3.5在结构有效性方面卓越。

关键词

引用

@article{arxiv.2508.05028,
  title  = {Evaluation of Finetuned LLMs in AMR Parsing},
  author = {Shu Han Ho},
  journal= {arXiv preprint arXiv:2508.05028},
  year   = {2025}
}

备注

27 pages, 32 figures