中文

解释性布局能否影响人们对含有仇恨言论的句子感知?

人机交互 2025-05-13 v2 人工智能 机器学习

摘要

本文进行用户研究,以评估三种机器学习(ML)解释性布局是否影响参与者对包含仇恨言论的句子的评估观点,聚焦“妇女压迫”和“种族主义”类别。鉴于文献中存在的结论不一致,我们通过统计和定性分析问卷响应,为在线社区中运用 ML 解释性提供实证依据。广义可加模型估计了参与者的评分,纳入了组内和组间设计。虽然我们的统计分析表明,解释性布局对参与者的观点没有显著影响,但我们的定性分析显示了 ML 解释性的优势:1)触发参与者对模型与其观点之间的差异提供纠正反馈;2)提供评估模型行为的洞见,超越传统性能指标。

关键词

引用

@article{arxiv.2403.05581,
  title  = {Can Interpretability Layouts Influence Human Perception of Offensive Sentences?},
  author = {Thiago Freitas dos Santos and Nardine Osman and Marco Schorlemmer},
  journal= {arXiv preprint arXiv:2403.05581},
  year   = {2025}
}