解决大规模语音翻译系统中的说话人性别偏见问题
计算与语言
2025-01-13 v1 人工智能
摘要
本研究针对语音翻译 (ST) 系统中的说话人性别偏见问题进行探讨,这种偏见可能导致翻译结果具有歧视和不准确。大规模 ST 系统中常见的男性偏见通常通过源自机器翻译 (MT) 系统的训练数据得以延续。我们的做法包含两个关键步骤:首先,我们利用大型语言模型 (LLM) 根据说话人的性别对翻译结果进行纠正;其次,我们使用纠正后的数据对 ST 模型进行微调,使其能够直接从音频线索生成性别特定的翻译,而无需显式提供性别信息。此外,我们提出一种三模式微调模型,适用于说话人性别已知或不应从语音线索推断的场景。我们在 MuST-SHE 测试集上展示了相较于基线及其他大规模 ST 系统(如 Seamless M4T 和 Canary)时,针对女性说话人的翻译改进了 70%。
引用
@article{arxiv.2501.05989,
title = {Addressing speaker gender bias in large scale speech translation systems},
author = {Shubham Bansal and Vikas Joshi and Harveen Chadha and Rupeshkumar Mehta and Jinyu Li},
journal= {arXiv preprint arXiv:2501.05989},
year = {2025}
}