中文

面向领域特定机器翻译与质量估计系统的研究

计算与语言 2026-03-27 v1 人工智能

摘要

机器翻译(MT)和质量估计(QE)在通用领域表现良好,但在领域不匹配时性能下降。本论文通过一系列以数据为导向的贡献,研究如何使MT 和 QE 系统适应特定领域。第 2 章介绍一种基于相似性的数据选择方法,用于MT。小规模的针对性领域子集在计算成本更低的情况下,优于大规模的通用数据集,并达到强大的翻译质量。第 3 章提出一种阶段性QE训练管道,将领域适应与轻量级数据增强相结合。该方法在不同领域、语言和资源设置下均取得改进,包括零样本和跨语言情形。第 4 章研究子词分词和词汇在微调中的作用。对齐的分词-词汇配置有助于稳定训练并实现更好的翻译质量,而不匹配的配置则降低性能。第 5 章提出一种面向大型语言模型的QE引导的情境学习方法。QE 模型选择能提升翻译质量的示例,而无需参数更新,且优于标准检索方法。该方法还支持无参考设置,减少对单一参考集的依赖。这些结果表明,领域适应取决于数据选择、表示以及高效的适应策略。本论文提供了构建在特定领域中可靠运行的MT 和 QE 系统的方法。

关键词

引用

@article{arxiv.2603.24955,
  title  = {Toward domain-specific machine translation and quality estimation systems},
  author = {Javad Pourmostafa Roshan Sharami},
  journal= {arXiv preprint arXiv:2603.24955},
  year   = {2026}
}

备注

PhD Dissertation