语言生成中的地理擦除
计算与语言
2023-10-24 v1 机器学习
摘要
大语言模型(LLMs)编码了海量的世界知识。然而,由于这些模型在大量互联网数据上训练,它们面临着过度捕获主导群体信息的风险。这种不平衡会传播到生成的语言中。在本工作中,我们研究并形式化了一种地理擦除现象,即语言模型对某些国家的预测不足。我们展示了在一系列 LLMs 中持续存在的擦除实例。我们发现擦除与训练语料中国家提及的低频强相关。最后,我们通过使用自定义目标进行微调来缓解擦除。
引用
@article{arxiv.2310.14777,
title = {Geographical Erasure in Language Generation},
author = {Pola Schwöbel and Jacek Golebiowski and Michele Donini and Cédric Archambeau and Danish Pruthi},
journal= {arXiv preprint arXiv:2310.14777},
year = {2023}
}
备注
EMNLP 2023 Findings