基于名称的小企业分类:消除性别与地理来源偏差
机器学习
2020-12-21 v1 人工智能
摘要
小企业分类在许多应用中(包括客户细分)是一项困难且重要的任务。以小企业名称为训练数据会引入性别和地理来源偏差。本工作开发了一个仅基于企业名称预测66种企业类型之一的模型(top-1 f1-score = 60.2%)。探讨了两种从该模型中去除偏差的方法:用占位符令牌替换给定名称,以及用性别交换样本扩充训练数据。报告了这些方法的结果,并通过向模型隐藏给定名称降低了模型中的偏差。然而,偏差的降低是以分类性能为代价实现的(top-1 f1-score = 56.6%)。在评估的数据集上,用性别交换样本扩充训练数据在降低偏差方面不如隐藏名称的方法有效。
引用
@article{arxiv.2012.10348,
title = {Small Business Classification By Name: Addressing Gender and Geographic Origin Biases},
author = {Daniel Shapiro},
journal= {arXiv preprint arXiv:2012.10348},
year = {2020}
}