中文

CoCoA-MT:用于对比可控机器翻译并应用于语体正式度的数据集与基准

计算与语言 2022-05-10 v1 人工智能

摘要

机器翻译(MT)任务通常被表述为对输入片段返回单一译文。然而在许多情况下,多种不同译文都是有效的,且恰当的译文可能取决于目标受众、说话者特征甚至说话者之间的关系。在处理敬语时会出现特定问题,特别是从英语翻译成具有正式度标记的语言时。例如,“Are you sure?” 在德语中可译为 “Sind Sie sich sicher?”(正式语体)或 “Bist du dir sicher?”(非正式)。使用错误或不一致的语气可能被某些文化和人群的用户视为不适当或突兀。本工作致力于从少量标注的对比数据中学习控制目标语言属性(此处为正式度)的问题。我们引入了一个标注数据集(CoCoA-MT)及相应的评测指标,用于训练和评估面向六种不同目标语言的正式度可控 MT 模型。我们表明,通过对标注对比数据微调可训练出正式度可控模型,在保持整体质量的同时达到高准确率(领域内 82%,领域外 73%)。

关键词

引用

@article{arxiv.2205.04022,
  title  = {CoCoA-MT: A Dataset and Benchmark for Contrastive Controlled MT with Application to Formality},
  author = {Maria Nădejde and Anna Currey and Benjamin Hsu and Xing Niu and Marcello Federico and Georgiana Dinu},
  journal= {arXiv preprint arXiv:2205.04022},
  year   = {2022}
}

备注

NAACL 2022