中文

透过标注者(不)一致性的视角看机器翻译的无监督词级质量估计

计算与语言 2025-11-18 v1 人工智能 人机交互

摘要

词级质量估计旨在自动识别机器翻译输出中的细粒度错误跨度,并已有许多应用,包括在译后编辑期间辅助翻译人员。现代 WQE 技术通常成本高昂,涉及对大型语言模型的提示或在大量人工标注数据上进行专门训练。在本工作中,我们利用语言模型可解释性和不确定性量化的最新进展,研究高效的替代方案,从翻译模型的内部工作机制中识别翻译错误。在我们涵盖 12 个翻译方向上的 14 个指标的评估中,我们通过使用多组人工标签来量化人工标签差异对指标性能的影响。我们的结果突出了无监督指标的未开发潜力、监督方法在面对标签不确定性时的缺陷,以及单标注者评估实践的脆弱性。

关键词

引用

@article{arxiv.2505.23183,
  title  = {Unsupervised Word-level Quality Estimation for Machine Translation Through the Lens of Annotators (Dis)agreement},
  author = {Gabriele Sarti and Vilém Zouhar and Malvina Nissim and Arianna Bisazza},
  journal= {arXiv preprint arXiv:2505.23183},
  year   = {2025}
}

备注

Under review. Code: https://github.com/gsarti/labl/tree/main/examples/unsup_wqe Metrics: https://huggingface.co/datasets/gsarti/unsup_wqe_metrics