中文

论述一项棘手难题:语言模型的语义推理基准

计算与语言 2026-05-20 v2

摘要

我们提出 SemanticQA,一个用于评估语言模型(LM)在语义短语处理任务中的表现的评估套件。该基准整合了现有的多词表达式(MwE)资源,并将其重新组织为统一的测试平台。它涵盖一般词汇现象(如词汇搭配),以及三个细粒度类别:习语、名词复合物和动词构式。通过 SemanticQA,我们评估了不同架构和规模的 LM 在提取、分类和解释任务中的表现,以及顺序任务组合。我们揭示了在需要语义推理的任务上存在显著的性能差异,突显了 LM 在推理效能和语义理解方面的差异,为推动 LM 在非平凡语义短语上的理解能力提供了洞见。SemanticQA 的评估工具和数据可在 https://github.com/jacklanda/SemanticQA 获取。

关键词

引用

@article{arxiv.2604.16593,
  title  = {Revisiting a Pain in the Neck: A Semantic Reasoning Benchmark for Language Models},
  author = {Yang Liu and Hongming Li and Melissa Xiaohui Qin and Qiankun Liu and Chao Huang},
  journal= {arXiv preprint arXiv:2604.16593},
  year   = {2026}
}

备注

ACL 2026 (Oral), 24 pages, 22 figures, 14 tables