如何充分利用LLM的语法知识进行可接受性判断
计算与语言
2025-02-10 v2 人工智能
摘要
语言模型(LMs)的语法知识通常通过语言最小对的基准来衡量,其中LMs被呈现一对可接受和不可接受的句子,并需要判断哪个更可接受。常规方法直接比较LMs分配的句子概率,但近期的大型语言模型(LLMs)是通过提示来执行任务的,因此它们分配的原始概率可能无法充分反映其语法知识。在本研究中,我们尝试使用提示和模板从LLMs中推导出更准确的可接受性判断。通过在英语和中文中的大量实验,我们比较了九种判断方法,发现其中两种——一种概率读出方法——in-template LP和一种基于提示的方法——Yes/No probability computing,取得了比常规方法更高的准确率。我们的分析揭示这些方法在不同的语言现象上表现优异,表明它们访问了LLMs知识的不同方面。我们还发现,将这两种方法集成(ensemble)的效果优于单一方法。因此,我们推荐这些技术,无论是单独使用还是集成使用,作为评估LLMs语法知识的更有效替代方案。
引用
@article{arxiv.2408.09639,
title = {How to Make the Most of LLMs' Grammatical Knowledge for Acceptability Judgments},
author = {Yusuke Ide and Yuto Nishida and Justin Vasselli and Miyu Oba and Yusuke Sakai and Hidetaka Kamigaito and Taro Watanabe},
journal= {arXiv preprint arXiv:2408.09639},
year = {2025}
}
备注
NAACL 2025 main