中文

面向数据高效机器翻译微调的动态联合批选择

计算与语言 2025-11-07 v1

摘要

数据质量及其有效选择是提高机器翻译模型性能的根本因素,构成稳健可靠翻译系统的基石。本文提出一种专为微调机器翻译系统设计的数据选择方法,利用学习模型与预训练参考模型之间的协同作用以提升整体训练效果。通过定义可学习性评分,本方法系统性地评估数据点对训练的实用性,确保只有最相关且具有影响力的示例参与微调过程。此外,本方法采用考虑数据点之间相互依赖性的批选择策略,在保持数据相关性的同时优化训练过程的效率。实验在英语至波斯语及其他多语言对使用 mBART 模型在 CCMatrix 数据集上微调后,表明本方法可实现数据效率相较于独立同分布基准方法提升最高可达五倍。实验结果指出,利用缓存嵌入可将计算效率提升 24 倍,因为所需训练数据点更少。此外,本方法还能增强泛化能力,相较于随机选择方法在翻译性能上表现更优。

关键词

引用

@article{arxiv.2511.04406,
  title  = {Dynamic Jointly Batch Selection for Data Efficient Machine Translation Fine-Tuning},
  author = {Mohammad Amin Ghanizadeh and Mohammad Javad Dousti},
  journal= {arXiv preprint arXiv:2511.04406},
  year   = {2025}
}