解释性布局能否影响人们对含有仇恨言论的句子感知?
人机交互
2025-05-13 v2 人工智能
机器学习
摘要
本文进行用户研究,以评估三种机器学习(ML)解释性布局是否影响参与者对包含仇恨言论的句子的评估观点,聚焦“妇女压迫”和“种族主义”类别。鉴于文献中存在的结论不一致,我们通过统计和定性分析问卷响应,为在线社区中运用 ML 解释性提供实证依据。广义可加模型估计了参与者的评分,纳入了组内和组间设计。虽然我们的统计分析表明,解释性布局对参与者的观点没有显著影响,但我们的定性分析显示了 ML 解释性的优势:1)触发参与者对模型与其观点之间的差异提供纠正反馈;2)提供评估模型行为的洞见,超越传统性能指标。
引用
@article{arxiv.2403.05581,
title = {Can Interpretability Layouts Influence Human Perception of Offensive Sentences?},
author = {Thiago Freitas dos Santos and Nardine Osman and Marco Schorlemmer},
journal= {arXiv preprint arXiv:2403.05581},
year = {2025}
}