中文

语音、偏见与指代代词:语音翻译中性别的可解释性研究

计算与语言 2026-04-29 v2 人工智能

摘要

与文本不同,语音通过声学线索(如音高)传递关于说话者的信息,如性别。这导致该模态特有的偏见问题。例如,在语音翻译 (speech translation, ST) 中,当从具有概念性性别的语言(如英语)翻译成语法性别歧义的语言时,指代说话者的术语会被赋予语法性别,说话者的声学特征可能在性别分配中发挥作用。这风险导致说话者被错误地指派性别,无论是通过默认的男性还是基于声音的假设。然而,ST 模型作出这些决定的机制尚不为人所知。我们调查 ST 模型在三种语言对 (en-es/fr/it) 中分配说话者指代术语性别的机制。为此,我们检视训练数据模式、内部语言模型 (internal language model, ILM) 的偏见以及声学信息之间的相互作用。我们发现模型并不简单地复制训练数据中的术语特定性别关联,而是学习更广泛的男性主导模式。尽管 ILM 表现出强烈的男性偏见,但模型可基于声学输入覆盖这些偏好。通过对语谱图进行对比特征归因,我们揭示了具有更高性别准确性的模型依赖于一种尚未被认识的机制:利用第一人称代词将性别化术语链接回说话者,访问分布在频谱中而非集中在音高处的性别信息。

引用

@article{arxiv.2511.21517,
  title  = {Voice, Bias, and Coreference: An Interpretability Study of Gender in Speech Translation},
  author = {Lina Conti and Dennis Fucci and Marco Gaido and Matteo Negri and Guillaume Wisniewski and Luisa Bentivogli},
  journal= {arXiv preprint arXiv:2511.21517},
  year   = {2026}
}

备注

Accepted to LREC 2026