属性控制器在预训练多语言翻译模型上的可迁移性研究
计算与语言
2024-01-25 v3 人工智能
摘要
使机器翻译模型符合期望属性(如正式度或语法性别)的定制化是一个被广泛研究的课题。然而,当前大多数方法依赖于带有属性标注的(半)监督数据。这种数据稀缺性阻碍了将此类定制能力普及到更广泛的语言,尤其是低资源语言。这一缺口与近期预训练大规模多语言翻译模型的进展不同步。为此,我们以 NLLB-200 模型为基础,将属性控制能力迁移至无属性标注数据的语言。受可控生成技术启发,我们采用基于梯度的推理时控制器来引导预训练模型。该控制器迁移至零样本条件下表现良好,因其作用于预训练的多语言表征且是属性相关而非语言特定的。通过与基于微调的控制进行全面比较,我们表明尽管微调在监督设定中明显占优,但在转向零样本条件时,其与推理时控制的差距缩小,尤其对于全新且疏远的目标语言。后者还展现出更强的领域鲁棒性。我们进一步表明推理时控制可补充微调。针对真实低资源语言孟加拉语的人工评估证实了我们的发现。我们的代码见 https://github.com/dannigt/attribute-controller-transfer
引用
@article{arxiv.2309.08565,
title = {How Transferable are Attribute Controllers on Pretrained Multilingual Translation Models?},
author = {Danni Liu and Jan Niehues},
journal= {arXiv preprint arXiv:2309.08565},
year = {2024}
}
备注
EACL 2024