中文

重访难题:语言模型的语义短语处理基准

计算与语言 2024-05-07 v1 人工智能 机器学习

摘要

我们引入 LexBench,一个综合性的评估套件,用于测试语言模型(LM)在十个语义短语处理任务上的表现。与先前研究不同,LexBench 是首个从比较视角构建通用语义短语(即词汇搭配)及三种细粒度语义短语(包括习语、名词复合词和动词结构)的框架。得益于 LexBench,我们评估了15种语言模型在分类、抽取和解释任务中的性能。通过实验,我们首先验证了规模定律,发现如预期,大型模型在大多数任务中优于较小的模型。其次,我们通过语义关系分类的规模分析发现,零样本学习模型在该任务中仍落后于普通微调模型。第三,通过人类评估,我们发现强大模型在语义短语处理方面的性能与人类水平相当。我们的基准测试发现可为未来研究提供参考,旨在提高语言模型在语义短语理解方面的通用能力。我们的源码和数据已公开于 https://github.com/jacklanda/LexBench

关键词

引用

@article{arxiv.2405.02861,
  title  = {Revisiting a Pain in the Neck: Semantic Phrase Processing Benchmark for Language Models},
  author = {Yang Liu and Melissa Xiaohui Qin and Hongming Li and Chao Huang},
  journal= {arXiv preprint arXiv:2405.02861},
  year   = {2024}
}

备注

24 pages, 17 figures, 10 tables