中文

大语言模型训练随机性对解释敏感性:以新闻文本分类为例

计算与语言 2024-10-08 v1

摘要

大语言模型(LLM)在自然语言处理任务中表现优异,但存在解释性挑战。本文考察了LLM训练中随机元素的作用对其预测解释性的影响。我们以法语意见化新闻文本分类任务为例进行研究。使用微调的CamemBERT模型和基于相关性传递的解释方法,我们发现不同随机种子训练的模型在相似的准确率下,解释结果差异较大。因此,我们主张需要对解释的统计分布进行表征,以确保LLM的解释性。我们随后探讨了一种基于文本特征的更简单模型,该模型提供稳定的解释,但准确率较低。因此,该更简单模型对应于准确率与解释性之间不同的权衡。我们最终展示了通过插入CamemBERT解释派生的特征来改进该模型的方法。我们最后讨论了由此结果所暗示的新研究方向,特别是关于观察到的训练随机性敏感性的来源。

关键词

引用

@article{arxiv.2410.05085,
  title  = {Explanation sensitivity to the randomness of large language models: the case of journalistic text classification},
  author = {Jeremie Bogaert and Marie-Catherine de Marneffe and Antonin Descampe and Louis Escouflaire and Cedrick Fairon and Francois-Xavier Standaert},
  journal= {arXiv preprint arXiv:2410.05085},
  year   = {2024}
}

备注

This paper is a faithful translation of a paper which was peer-reviewed and published in the French journal Traitement Automatique des Langues, n. 64