文本分类模型的独立伦理评估:以仇恨言论检测为例
计算机与社会
2021-08-18 v1 计算与语言
信息检索
摘要
人工智能系统的独立伦理评估是对系统开发、部署和使用是否符合伦理价值的公正审查。过去几年中,已发展出描述高层需求的系统级定性框架,以及衡量个体伦理维度的组件级定量指标。然而,二者之间存在鸿沟,阻碍了独立伦理评估在实践中的执行。本研究弥合了这一鸿沟,并设计了一个针对文本分类模型的整体独立伦理评估流程,特别关注仇恨言论检测任务。该评估进一步辅以受保护属性挖掘和基于反事实的分析,以增强偏见评估。它涵盖技术性能、数据偏见、嵌入偏见、分类偏见和可解释性的评估。所提出的流程通过对一个深度仇恨言论检测模型的评估得以演示。
引用
@article{arxiv.2108.07627,
title = {Independent Ethical Assessment of Text Classification Models: A Hate Speech Detection Case Study},
author = {Amitoj Singh and Jingshu Chen and Lihao Zhang and Amin Rasekh and Ilana Golbin and Anand Rao},
journal= {arXiv preprint arXiv:2108.07627},
year = {2021}
}
备注
27th SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2021), August 14 - 18, 2021 - Singapore