中文

用于反事实公平性的高效可解释Transformer

机器学习 2026-04-30 v1

摘要

机器学习模型在金融和保险等高风险、高度监管领域的日益增长的依赖,加剧了预测性能、可解释性和监管公平性要求之间的张力。在这些场景下,模型不仅要提供可靠的预测,还要提供透明的决策依据并遵守严格的公平性要求。注意力机制的Transformer在各种语言任务中展示了建模复杂数据关系的强大能力,但其注意力机制本身并不能确保即使结合公平感知技术也能实现反事实公平的预测。为此,我们提出了特征相关Transformer (FCorrTransformer),一种针对表格数据的注意力轻型架构。在此设计中,注意力矩阵可直接解释为成对特征依赖性,增强了可解释性和效率。借助此结构,我们引入了反事实注意力正则化 (CAR),一种在注意力层强制敏感特征的群组不变公平表示的框架,促进无需依赖显式因果假设的反事实公平预测。在不平衡分类和回归基准测试中的经验评估表明,FCorrTransformer结合CAR在保持竞争性预测性能的同时,实现了强大的反事实公平,显著降低了与标准基于Transformer的基线相比的模型复杂度。总体而言,本工作填补了公平性理论与机器学习模型之间的关键鸿沟,提供了一个在监管敏感领域的负责任AI实践框架。

关键词

引用

@article{arxiv.2604.26188,
  title  = {Efficient and Interpretable Transformer for Counterfactual Fairness},
  author = {Panyi Dong and Zhiyu Quan},
  journal= {arXiv preprint arXiv:2604.26188},
  year   = {2026}
}