中文

语言模型理解语言吗?

计算与语言 2025-09-17 v1

摘要

尽管在自然语言生成和理解方面取得了进展,语言模型(LM)在处理时态、否定、语态和情态等细粒度语言现象时仍然存在困难,而这些现象是有效人际交流的核心要素。在联合国可持续发展目标 4(SDG 4)的背景下,语言清晰度至关重要,在教育技术中部署 LM 需要经过仔细审查。随着 LM 越来越多地驱动辅导系统、自动评分和翻译等应用,其与人类语言解释的对齐对于有效学习变得至关重要。在本研究中,我们在英语和孟加拉语的这些具有挑战性的情境下,对 SOTA 语言模型进行了评估。为了确保结构化的评估,我们引入了一套新的系统环境认知推理评估路线指南。我们提出的 LUCID 数据集由精心设计的英语和孟加拉语句子对组成,专门在语言理解的关键方面(包括否定、时态、语态变化)挑战这些模型。我们使用 Pearson 相关系数、Spearman 相关系数和平均绝对误差等标准指标,以及新颖的受语言学启发的指标 HCE 准确率,评估了包括 MISTRAL-SABA-24B、LLaMA-4-Scout-17B、LLaMA-3.3-70B、Gemma2-9B 和 Compound-Beta 在内的 SOTA 模型的性能。HCE 准确率衡量模型预测落在人类评分均值的一个标准差内的频率,从而捕捉人类对语言解释变异的容忍度。我们的发现表明,Compound-Beta 是最平衡的模型,在多样的语言条件下持续实现高相关性和低 MAE。它在英语中记录了最高的 Pearson 相关系数,并在混合语言数据上表现出稳健的性能,表明在跨语言场景中与人类判断的强烈对齐。

关键词

引用

@article{arxiv.2509.12459,
  title  = {Does Language Model Understand Language?},
  author = {Suvojit Acharjee and Utathya Aich and Asfak Ali},
  journal= {arXiv preprint arXiv:2509.12459},
  year   = {2025}
}