迈向多模态与多语言翻译中的红队测试
计算与语言
2024-01-30 v1 计算机与社会
摘要
评估自然语言处理的性能正变得越来越复杂。一个特别的挑战是评估数据集可能与训练数据直接或间接重叠,这可能导致结果偏差和模型性能的高估。因此,人工评估作为评估模型性能和可靠性的一种手段,正受到越来越多的关注。其中一种方法是红队测试方法,其目的是生成模型会产生严重错误的边缘情况。虽然这种方法论正在成为生成式人工智能的标准实践,但其在条件式人工智能领域的应用在很大程度上仍未得到探索。本文提出了首个基于人工的机器翻译(MT)红队测试研究,标志着朝着理解和改进翻译模型性能迈出了重要一步。我们深入研究了基于人工的红队测试和一项关于自动化的研究,报告了经验教训,并为翻译模型和红队测试演练提供了建议。这项开创性工作为机器翻译领域的研究和开发开辟了新途径。
引用
@article{arxiv.2401.16247,
title = {Towards Red Teaming in Multimodal and Multilingual Translation},
author = {Christophe Ropers and David Dale and Prangthip Hansanti and Gabriel Mejia Gonzalez and Ivan Evtimov and Corinne Wong and Christophe Touret and Kristina Pereyra and Seohyun Sonia Kim and Cristian Canton Ferrer and Pierre Andrews and Marta R. Costa-jussà},
journal= {arXiv preprint arXiv:2401.16247},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2312.05187