HEARTS:面向可解释、可持续与鲁棒文本刻板印象检测的综合框架
计算与语言
2025-01-22 v3
摘要
刻板印�是关于社会群体的概括性假设,尽管基于注意力学习的前沿大语言模型在识别刻板印象方面仍存在挑战。由于刻板印象的主观性质——即何为刻板印象因文化、社会和个人视角而异——可解释性尤为关键。可解释模型确保这些细微判断可被人类用户理解和验证,从而促进信任与问责。我们引入HEARTS(Holistic Framework for Explainable, Sustainable, and Robust Text Stereotype Detection),一个提升模型性能、降低碳足迹并提供透明可解释解释的框架。我们构建扩充多粒度刻板印象数据集(EMGSD),包含57,201个标记文本,涵盖六个群体,包括LGBTQ+和地域刻板印象等边缘群体。消融研究表明,在EMGSD上微调的BERT模型优于在单个组件上训练的模型。我们随后使用SHAP分析微调且高效的ALBERT-V2模型,生成词元级重要性值,确保与人类理解一致,并通过比较SHAP和LIME输出计算可解释性置信度得分。
引用
@article{arxiv.2409.11579,
title = {HEARTS: A Holistic Framework for Explainable, Sustainable and Robust Text Stereotype Detection},
author = {Theo King and Zekun Wu and Adriano Koshiyama and Emre Kazim and Philip Treleaven},
journal= {arXiv preprint arXiv:2409.11579},
year = {2025}
}
备注
NeurIPS 2024 SoLaR Workshop and NeurIPS 2024 Safety Gen AI Workshop