回到未来:论 NLP 中的潜在历史
计算与语言
2022-10-13 v1
摘要
机器学习与 NLP 需要构建数据集以训练和微调模型。在此背景下,先前工作已表明这些数据集的敏感性。例如,数据中潜在的社会偏见很可能被编码进我们所部署的模型,并在其中被放大。本工作中,我们借鉴历史学领域的发展,对这些问题的审视采取新颖视角:通过历史小说的透镜考量数据集与模型,可显现其政治属性,并得以重新配置我们看待过去的方式,从而让边缘化话语浮现。基于此类洞见,我们认为当代机器学习方法偏向于主导性与霸权式历史。以新代词(neopronouns)为例,我们展示通过在当代语境中浮现边缘化历史,可创建更好地代表传统上被边缘化与排斥群体生活现实的模型。
引用
@article{arxiv.2210.06245,
title = {Back to the Future: On Potential Histories in NLP},
author = {Zeerak Talat and Anne Lauscher},
journal= {arXiv preprint arXiv:2210.06245},
year = {2022}
}