SocioProbe:语言模型学习社会人口统计信息的什么、何时与何地
计算与语言
2022-11-09 v1
摘要
预训练语言模型(PLMs)在广泛任务上的表现已超越其他 NLP 模型。为了更透彻地理解其能力与内部机制,研究人员已确立了它们在多大程度上捕获了语法性等较低层次的知识,以及事实理解等中层语义知识。然而,对于它们对语言更高层次方面的知识,目前仍知之甚少。特别是,尽管社会人口统计特征在塑造我们的语言方面具有重要性,但 PLMs 是否、在何处以及如何编码这些特征(例如性别或年龄)的问题仍未被探索。我们通过传统分类器探测和信息论最小描述长度探测,探测了不同单 GPU PLMs 在多个英语数据集上的社会人口统计知识,从而填补了这一研究空白。我们的结果表明,PLMs 确实编码了这些社会人口统计信息,并且这些知识有时分布在某些被测试 PLMs 的各层中。我们进一步进行了多语言分析,并研究了补充训练的影响,以进一步探索这些知识在多大程度上、在何处以及以多少预训练数据被编码。我们的总体结果表明,社会人口统计知识对 NLP 仍是一个重大挑战。PLMs 需要大量预训练数据才能获取这些知识,而在一般语言理解方面表现优异的模型似乎并未拥有更多关于这些方面的知识。
引用
@article{arxiv.2211.04281,
title = {SocioProbe: What, When, and Where Language Models Learn about Sociodemographics},
author = {Anne Lauscher and Federico Bianchi and Samuel Bowman and Dirk Hovy},
journal= {arXiv preprint arXiv:2211.04281},
year = {2022}
}
备注
Accepted for publication at EMNLP 2022