Bi-Attention HateXplain:在多任务上下文中考虑数据的序列特性以实现可解释性
计算与语言
2026-01-21 v1 人工智能
摘要
互联网和在线社交网络的技术进步为人类带来了诸多益处。与此同时,这种增长也导致了仇恨言论的增加,这是主要的全球威胁。为提高用于仇恨言论检测的黑盒模型的可靠性,LIME、SHAP 和 LRP 等事后方法在分类模型训练后提供解释。相比之下,基于 HateXplain 基准的多任务方法同时学习解释与分类。然而,基于 HateXplain 的算法结果表明,本应保持恒定的预测注意力却变化显著。这种注意力的多变性可能导致解释不一致、预测不稳定以及学习困难。为解决此问题,我们提出 BiAtt-BiRNN-HateXplain(双向注意力 BiRNN HateXplain)模型;鉴于对透明度的需求,与更为复杂的 LLM 相比,该模型更易于解释,并且借助 BiRNN 层在可解释性过程中考虑了输入数据的序列特性。因此,如果通过多任务学习(可解释性与分类任务)正确估计了解释,该模型可以更好地进行分类,并减少与社区相关的无意偏见错误。在 HateXplain 数据上的实验结果表明,检测性能和可解释性均有明显提升,且无意偏见有所减少。
引用
@article{arxiv.2601.13018,
title = {Bi-Attention HateXplain : Taking into account the sequential aspect of data during explainability in a multi-task context},
author = {Ghislain Dorian Tchuente Mondjo},
journal= {arXiv preprint arXiv:2601.13018},
year = {2026}
}
备注
Accepted at "EAI AFRICOMM 2025 - 17th EAI International Conference on Communications and Networks in Africa"