预训练语言模型中表征性危害度量指标的实证研究
计算与语言
2023-01-24 v1 人工智能
摘要
大规模预训练语言模型(PTLMs)从包含潜在社会偏见与有毒内容的大量人类书写数据中获取知识。在本文中,我们利用 PTLMs 的主要任务即语言建模,提出一种新度量指标,以量化 PTLMs 中对 13 个边缘化群体所表现出的内隐表征性危害(representational harms)。使用该指标,我们对 24 个广泛使用的 PTLMs 进行了实证分析。我们的分析揭示了本工作所提指标与其他表征性危害相关指标之间的相关性。我们观察到我们的指标与文献中大多数性别特定指标相关。通过大量实验,我们从深度和宽度两个维度探究了 PTLMs 架构与表征性危害之间的联系。我们发现,相较于宽度,优先增加深度可缓解某些 PTLMs 中的表征性危害。我们的代码与数据见 https://github.com/microsoft/SafeNLP。
引用
@article{arxiv.2301.09211,
title = {An Empirical Study of Metrics to Measure Representational Harms in Pre-Trained Language Models},
author = {Saghar Hosseini and Hamid Palangi and Ahmed Hassan Awadallah},
journal= {arXiv preprint arXiv:2301.09211},
year = {2023}
}
备注
17 pages,