基于 Transformer 模型的多领域道德情感分类公平性指标设计探索
计算与语言
2025-10-14 v1 人工智能
摘要
在跨域迁移场景下,确保自然语言处理中道德情感分类的公平性具有挑战性,尤其是当 transformer 模型被广泛部署时。本文使用道德基础推特语料库 (MFTC) 和道德基础 Reddit 语料库 (MFRC),评估 BERT 和 DistilBERT 在多标签设置下的表现,包括原域和跨域协议。整体性能可能掩盖了差异:我们观察到迁移过程中存在显著的不对称性,Twitter->Reddit 的微-F1 下降 14.9%,而 Reddit->Twitter 仅下降 1.5%。按标签分析揭示了被整体分数掩盖的公平性违规情况;值得注意的是,权威标签显示出 0.22-0.23 的人口统计公平性差异和 0.40-0.41 的平等机会差异。在解决这一差距方面,我们引入了道德公平性一致性 (MFC) 指标,用于量化道德基础检测的跨域稳定性。MFC 显示出强大的经验有效性,与人口统计公平性差异呈完美负相关 (rho = -1.000, p < 0.001),且独立于标准性能指标。在所有标签中,忠诚度表现出最高的一致性 (MFC = 0.96),而权威性则最低 (MFC = 0.78)。这些发现确立了 MFC 作为道德推理模型公平性评估的补充诊断性指标,使其在异构语言语境中实现更可靠的部署。
引用
@article{arxiv.2510.11222,
title = {Fairness Metric Design Exploration in Multi-Domain Moral Sentiment Classification using Transformer-Based Models},
author = {Battemuulen Naranbat and Seyed Sahand Mohammadi Ziabari and Yousuf Nasser Al Husaini and Ali Mohammed Mansoor Alsahag},
journal= {arXiv preprint arXiv:2510.11222},
year = {2025}
}