中文

跨性别、年龄与种族的摘要系统评估

计算与语言 2021-10-12 v1

摘要

摘要系统最终由人类标注者和评分者评估。通常,标注者和评分者不能反映终端用户的人口统计特征,而是通过学生群体或人口统计偏斜的众包平台招募。针对两种不同的评估场景——对照黄金摘要的评估与系统输出评分——我们表明摘要评估对受保护属性敏感。这会严重偏倚系统开发与评估,导致我们构建偏向某些群体而非其他群体的模型。

关键词

引用

@article{arxiv.2110.04384,
  title  = {Evaluation of Summarization Systems across Gender, Age, and Race},
  author = {Anna Jørgensen and Anders Søgaard},
  journal= {arXiv preprint arXiv:2110.04384},
  year   = {2021}
}