中文

如何构建具有竞争力的多性别语音翻译模型以控制说话人性别翻译

计算与语言 2023-10-24 v1

摘要

当从概念性别语言(如英语)翻译到语法性别语言(如意大利语)时,生成的译文需要对包括指代说话人在内的各类词语进行显式性别赋值。当源句未传达说话人性别时,语音翻译(ST)模型要么依赖说话人可能具误导性的声音特征,要么默认使用现有训练语料中最常见的阳性性别。为避免此类有偏且不具包容性的行为,说话人相关表达的性别赋值应由外部提供的说话人性别元数据引导。尽管先前工作表明最有效的方法是使用独立的、专用的性别专用模型,本文的目标是通过将说话人性别元数据集成到单一的“多性别”神经ST模型中来实现相同结果,从而更易于维护。我们的实验表明,从零开始训练时,单一多性别模型优于性别专用模型(阴性形式的性别准确率提升高达12.9),而从现有ST模型微调则无法取得有竞争力的结果。

关键词

引用

@article{arxiv.2310.15114,
  title  = {How To Build Competitive Multi-gender Speech Translation Models For Controlling Speaker Gender Translation},
  author = {Marco Gaido and Dennis Fucci and Matteo Negri and Luisa Bentivogli},
  journal= {arXiv preprint arXiv:2310.15114},
  year   = {2023}
}

备注

To appear in CLiC-it 2023