中文

对比解释揭示翻译模型中性别选择的触发机制

计算与语言 2026-03-05 v2

摘要

可解释性方法可用于理解(黑盒)模型所作决定,如神经机器翻译 (NMT) 或大型语言模型 (LLM)。然而, 该领域的研究在揭示这些模型固有问题——性别偏见——的来源方面仍有限。本文旨在超越单纯衡量偏见,探究其根源。我们运用带有性别歧义的自然源语言数据, 对探索性研究检视哪些上下文(即源句中输入标记)会影响 NMT 模型对目标语言(德语/西班牙语)中性别变位的选择。为进行分析, 我们计算基于对比翻译的感性归因。首先, 我们针对评分阈值缺失的挑战, 特别检视源词对模型性别决定的不同归因水平。我们将显著源词与人类对性别的感知进行比较, 结果显示人类感知与模型归因之间存在显著重叠。此外, 我们对显著词进行语言学分析。本工作阐明了理解模型翻译决策中涉及性别的重要性, 以及这些决策如何与人类决策相比较, 并指出应利用此信息来缓解性别偏见。

关键词

引用

@article{arxiv.2512.08440,
  title  = {What Triggers my Model? Contrastive Explanations Inform Gender Choices by Translation Models},
  author = {Janiça Hackenbuchner and Arda Tezcan and Joke Daems},
  journal= {arXiv preprint arXiv:2512.08440},
  year   = {2026}
}

备注

Accepted at LREC 2026