基于深度学习方法的有毒评论判定与无意识模型偏差最小化
机器学习
2023-11-09 v1 计算与语言
计算机与社会
摘要
在线对话可能具有毒性并遭受威胁、辱骂或骚扰。为识别有毒文本评论,多年来已提出若干深度学习与机器学习模型。然而,近期研究表明,由于训练数据的不平衡,某些模型更可能表现出包括性别偏差与身份偏差在内的无意识偏差。在本研究中,我们的目标是通过微调一种称为 BERT(Bidirectional Encoder Representation from Transformers,基于变换器的双向编码器表示)的注意力模型,检测有毒评论并减少 concerning 身份特征(如种族、性别、性取向、宗教)的无意识偏差。我们应用加权损失以解决数据不平衡问题,并在分类与偏差最小化方面将微调 BERT 模型与传统逻辑回归模型进行比较。采用 TFIDF 向量化器的逻辑回归模型达到 57.1% 的准确率,而微调 BERT 模型的准确率为 89%。代码见 https://github.com/zim10/Determine_Toxic_comment_and_identity_bias.git
引用
@article{arxiv.2311.04789,
title = {Determination of toxic comments and unintended model bias minimization using Deep learning approach},
author = {Md Azim Khan},
journal= {arXiv preprint arXiv:2311.04789},
year = {2023}
}