迈向细粒度信息:识别翻译错误的类型与位置
计算与语言
2023-02-20 v1
摘要
关于翻译错误的细粒度信息对翻译评估社区很有帮助。现有方法无法同步考虑错误位置和类型,未能整合两者的错误信息。本文提出了细粒度翻译错误检测(FG-TED)任务,旨在同时识别给定源文-假设句对中翻译错误的位置和类型。此外,我们构建了一个FG-TED模型来预测增译和漏译这两种典型的翻译准确性错误。首先,我们使用词级分类范式构建模型,并利用捷径学习减少技术来减轻单语特征的影响。其次,我们构建了用于模型训练的合成数据集,并缓解了权威数据集中数据标注的不一致性,使实验基准协调一致。实验表明,我们的模型能够同时识别错误类型和位置,并在恢复的数据集上取得了最先进的结果。与现有基线相比,我们的模型在低资源和迁移场景下也能提供更可靠的预测。相关数据集和源代码将在未来发布。
引用
@article{arxiv.2302.08975,
title = {Towards Fine-Grained Information: Identifying the Type and Location of Translation Errors},
author = {Keqin Bao and Yu Wan and Dayiheng Liu and Baosong Yang and Wenqiang Lei and Xiangnan He and Derek F. Wong and Jun Xie},
journal= {arXiv preprint arXiv:2302.08975},
year = {2023}
}