FairyTED:一种面向 TED 演讲数据的公平评分预测器
机器学习
2019-11-27 v1 计算与语言
机器学习
摘要
随着近期机器学习在人类生活各方面应用的趋势,将公平性纳入预测算法的核心十分重要。我们解决了在预测公开演讲质量时,对演讲者敏感属性(如性别与种族)保持公平的问题。我们以 TED 演讲作为公开演讲的输入库,因其包含来自多元社区的演讲者且传播广泛。利用因果模型、反事实公平(Counterfactual Fairness)及最先进的神经语言模型理论,我们提出了一种公平预测公开演讲质量的数学框架。我们采用有依据的假设构建捕获不同属性如何影响公开演讲质量的因果模型,该因果模型有助于生成反事实数据以训练公平预测模型。我们的框架具有足够通用性,可利用因果模型内的任意假设。实验结果表明,在预测精度与近期该数据集上工作相当的同时,相较于真实数据标签,我们的预测在一种新颖指标下具有反事实公平性。FairyTED 设置不仅使组织者能从未观测的反事实可能性中做出知情且多元的演讲者选择,也确保观众与新用户在决定观看某演讲时,不受来自 www.ted.com 网站任意访客不公平且不均衡评分的影响。
引用
@article{arxiv.1911.11558,
title = {FairyTED: A Fair Rating Predictor for TED Talk Data},
author = {Rupam Acharyya and Shouman Das and Ankani Chattoraj and Md. Iftekhar Tanveer},
journal= {arXiv preprint arXiv:1911.11558},
year = {2019}
}
备注
9 pages, 4 figures, 3 tables. Accepted as a conference paper to be presented at AAAI 2020