契合谁的正确理由才称得上正确?
计算与语言
2023-10-16 v2 人机交互
摘要
可解释性方法被用于衡量模型预测与人类理由(即“基于正确理由的正确预测”)的一致程度。然而,以往工作未能认识到,什么算作理由有时是主观的。本文呈现了我们认为的首个此类成果:一个增补了标注者人口统计信息的人类理由标注集合。我们覆盖了跨越情感分析和常识推理的三个数据集,以及六个人口统计群体(在年龄和族裔上均衡)。此类数据使我们能够同时追问:我们的预测与哪些人口统计群体一致,以及我们模型的理由与谁的推理模式一致。我们发现系统性的群体间标注者分歧,并展示了 16 个基于 Transformer 的模型如何更好地与特定人口统计群体提供的理由对齐:我们发现模型偏向于与年长和/或白人标注者最佳对齐。我们深入考察了模型规模和模型蒸馏的影响,发现——与我们的预期相反——模型规模与理由一致性之间存在负相关,并且没有证据表明模型规模或模型蒸馏能改善公平性。
引用
@article{arxiv.2306.00639,
title = {Being Right for Whose Right Reasons?},
author = {Terne Sasha Thorn Jakobsen and Laura Cabello and Anders Søgaard},
journal= {arXiv preprint arXiv:2306.00639},
year = {2023}
}
备注
In Proceedings of ACL 2023