中文

更好地评估零样本依存句法分析中的 LLM

计算与语言 2025-03-03 v1

摘要

尽管 LLM 在零样本任务中表现出色,但它们在句法分析等语言学挑战中的表现却较少受到审视。本文通过将 SOTA 开源权重 LLM 与无法获取输入句子的基线进行比较,研究了它们在该任务上的表现,这些基线包括此前未在此情境下使用过的基线,如随机投影树或最优线性排列。结果表明,大多数受测 LLM 无法超越最佳的无信息基线,只有最新且最大版本的 LLaMA 在大多数语言上做到了这一点,但性能依然相当低。因此,开源 LLM 尚无法实现准确的零样本句法分析。

关键词

引用

@article{arxiv.2502.20866,
  title  = {Better Benchmarking LLMs for Zero-Shot Dependency Parsing},
  author = {Ana Ezquerro and Carlos Gómez-Rodríguez and David Vilares},
  journal= {arXiv preprint arXiv:2502.20866},
  year   = {2025}
}

备注

Accepted at NoDaLiDa/Baltic-HLT 2025