中文

使用对比集评估大语言模型:一种实验方法

计算与语言 2024-10-03 v2 人工智能 机器学习

摘要

在自然语言推理(NLI)领域,特别是在涉及多输入文本分类的任务中,交叉熵损失度量被广泛用作误差测量的标准。然而,该度量在有效评估模型理解语言蕴含的能力方面存在不足。在本研究中,我们引入了一种为斯坦福自然语言推理(SNLI)数据集生成对比集的创新技术。我们的策略涉及自动用同义词替换动词、副词和形容词,以保留句子的原始含义。该方法旨在评估模型的性能是基于真正的语言理解还是仅仅基于模式识别。我们使用ELECTRA-small模型进行了分析。该模型在传统SNLI数据集上达到了89.9%的准确率,但在我们的对比集上准确率降至72.5%,下降了17%。这一结果促使我们对模型的学习行为进行了详细检查。随后,我们通过使用专门为SNLI设计的对比增强训练数据集对模型进行微调,提高了其鲁棒性,使其在对比集上的准确率提高到85.5%。我们的发现强调了在NLI任务的数据集中纳入多样化语言表达的重要性。我们希望我们的研究能够鼓励创建更具包容性的数据集,从而有助于开发更复杂、更有效的NLI模型。

关键词

引用

@article{arxiv.2404.01569,
  title  = {Evaluating Large Language Models Using Contrast Sets: An Experimental Approach},
  author = {Manish Sanwal},
  journal= {arXiv preprint arXiv:2404.01569},
  year   = {2024}
}