中文

基于构式 NLI 微调评估 LLM 中的构式语法泛化能力

计算与语言 2025-09-23 v1

摘要

我们探究大语言模型学习构式语法所定义的深层形义映射的能力。我们引入了 ConTest-NLI 基准,包含 8 万个句子,涵盖从高度词汇化到高度图式化的八种英语构式。我们的流程通过模板化和模型在环过滤器生成多样化的合成 NLI 三元组。这提供了人工验证的各个方面,以确保挑战性和标签可靠性。对领先 LLM 的零样本测试显示,自然数据(88%)和对抗数据(64%)之间的准确率下降了 24%,其中图式模式被证明最为困难。在 ConTest-NLI 子集上进行微调可带来高达 9% 的提升,然而我们的结果突出了当前 LLM 中持续存在的抽象差距,并提供了一个可扩展的框架来评估构式驱动的学习。

关键词

引用

@article{arxiv.2509.16422,
  title  = {Evaluating CxG Generalisation in LLMs via Construction-Based NLI Fine Tuning},
  author = {Tom Mackintosh and Harish Tayyar Madabushi and Claire Bonial},
  journal= {arXiv preprint arXiv:2509.16422},
  year   = {2025}
}