DLAMA:一个用于策划文化多元事实以探测预训练语言模型知识的框架
计算与语言
2023-06-09 v1
摘要
已有一些基准数据集被发布用于评估预训练语言模型的事实知识。这些基准(如LAMA和ParaRel)主要以英语开发,随后被翻译以形成新的多语言版本(如mLAMA和mParaRel)。在这些多语言基准上的结果表明,使用英语提示从多语言模型中回忆事实通常比使用非英语提示取得显著更好且更一致的性能。我们的分析显示,mLAMA偏向于来自西方国家的事实,这可能影响探测模型的公平性。我们提出了一个从Wikidata中策划具有文化多样性事实三元组的新框架。新基准DLAMA-v1由来自三对对比文化的事实三元组构建,包含来自20个关系谓词的共计78,259个三元组。这三对分别代表了(阿拉伯与西方)、(亚洲与西方)和(南美与西方)国家的事实。拥有一个更均衡的基准(DLAMA-v1)支持了mBERT在西方事实上表现优于非西方事实,而单语阿拉伯语、英语和韩语模型往往在其文化相近事实上表现更好。此外,单语和多语言模型都倾向于做出在文化或地理上与正确标签相关的预测,即使预测是错误的。
引用
@article{arxiv.2306.05076,
title = {DLAMA: A Framework for Curating Culturally Diverse Facts for Probing the Knowledge of Pretrained Language Models},
author = {Amr Keleg and Walid Magdy},
journal= {arXiv preprint arXiv:2306.05076},
year = {2023}
}
备注
Accepted to ACL 2023 (Findings)