中文

存疑时咨询:基于置信度路由的专家辩论性别歧视检测

计算与语言 2026-01-08 v3 人工智能

摘要

网络性别歧视越来越多地以微妙的、依赖上下文的形式出现,从而逃避了传统的检测方法。其解释通常取决于重叠的语言、心理、法律和文化维度,这在标注数据集中产生了混合且有时相互矛盾的信号。这些不一致性,加上标签稀缺和类别不平衡,导致决策边界不稳定,并使微调后的模型忽略更微妙、代表性不足的伤害形式。为了应对这些挑战,我们提出了一个两阶段框架,该框架统一了 针对稀缺和噪声数据的更好监督正则化的目标训练程序,以及 处理模糊或边界情况的选择性、基于推理的推断。首先,我们结合类平衡焦点损失、类感知批处理和事后阈值校准来稳定训练,这些策略首次针对该领域进行了调整,以缓解标签不平衡和噪声监督。其次,我们通过一种动态路由机制弥合了效率与推理之间的差距,该机制区分了明确实例和需要审议过程的复杂案例。这种推理过程产生了新颖的协作专家判断 (CEJ) 模块,该模块提示多个角色并通过判断模型整合其推理。我们的方法在多个公共基准上优于现有方法,在 EDOS 任务 A 和 B 上的 F1 分别提高了 +4.48% 和 +1.30%,在 EXIST 2025 任务 1.1 上的 ICM 提高了 +2.79%。

关键词

引用

@article{arxiv.2512.23732,
  title  = {When in Doubt, Consult: Expert Debate for Sexism Detection via Confidence-Based Routing},
  author = {Anwar Alajmi and Gabriele Pergola},
  journal= {arXiv preprint arXiv:2512.23732},
  year   = {2026}
}