基于概念的解释用于检测滥用语言分类器学到的虚假因果关系
计算与语言
2023-07-06 v1 人工智能
摘要
分类器倾向于在过度表示的概念与标签之间学习到虚假因果关系,这可能导致对该概念的过度依赖以及分类精度受损。必须有能够比较不同模型并识别对特定概念过度依赖的方法。我们考虑三个在大型英文数据集上训练的知名滥用语言分类器,并聚焦于负面情绪这一概念,它是一个重要信号,但不应被学习为滥用标签的充分特征。受全局充分性定义的启发,我们首先通过在所有决策阈值上评估其在挑战集上的准确率,来检验分类器学到的不必要依赖。进一步,认识到挑战集可能并非总是可用,我们引入基于概念的解释度量来评估概念对标签的影响。这些解释使我们能够就概念与标签之间学到的虚假全局充分性的程度来比较分类器。
引用
@article{arxiv.2307.01900,
title = {Concept-Based Explanations to Test for False Causal Relationships Learned by Abusive Language Classifiers},
author = {Isar Nejadgholi and Svetlana Kiritchenko and Kathleen C. Fraser and Esma Balkır},
journal= {arXiv preprint arXiv:2307.01900},
year = {2023}
}
备注
Published at WOAH2023 co-located with ACL2023