用于检测非预期模型偏差的扰动敏感性分析
计算与语言
2019-10-11 v1
摘要
数据驱动的统计自然语言处理(NLP)技术利用大量语言数据来构建能够理解语言的模型。然而,大多数语言数据反映了数据产生时的公共话语,因此除一般语言意义外,NLP 模型容易习得特定时间点上具名指称对象及其偶然关联。一个旨在建模情感与毒性等概念的 NLP 系统,理想情况下应产生与文本中所提及实体身份及其社会关联无关的分数。例如,在通用情感分析系统中,诸如“我讨厌 Katy Perry”的短语应被解释为与“我讨厌 Taylor Swift”具有相同的情感。基于该思想,我们提出了一种通用评估框架——扰动敏感性分析,用于检测与具名实体相关的非预期模型偏差,且无需新的标注或语料库。我们通过在两个不同 NLP 模型(一个情感模型和一个毒性模型)上应用于来自四种不同体裁的英文在线评论,展示了该分析的有效性。
引用
@article{arxiv.1910.04210,
title = {Perturbation Sensitivity Analysis to Detect Unintended Model Biases},
author = {Vinodkumar Prabhakaran and Ben Hutchinson and Margaret Mitchell},
journal= {arXiv preprint arXiv:1910.04210},
year = {2019}
}
备注
EMNLP 2019 Short Paper