跨性别、年龄与种族的摘要系统评估
计算与语言
2021-10-12 v1
摘要
摘要系统最终由人类标注者和评分者评估。通常,标注者和评分者不能反映终端用户的人口统计特征,而是通过学生群体或人口统计偏斜的众包平台招募。针对两种不同的评估场景——对照黄金摘要的评估与系统输出评分——我们表明摘要评估对受保护属性敏感。这会严重偏倚系统开发与评估,导致我们构建偏向某些群体而非其他群体的模型。
引用
@article{arxiv.2110.04384,
title = {Evaluation of Summarization Systems across Gender, Age, and Race},
author = {Anna Jørgensen and Anders Søgaard},
journal= {arXiv preprint arXiv:2110.04384},
year = {2021}
}