中文

翻译质量评估(TQE)中的不确定性度量

计算与语言 2021-11-16 v1 数值分析 数值分析 应用统计

摘要

从人工译员(HT)和机器翻译(MT)研究者的角度来看,翻译质量评估(TQE)是一项关键任务。翻译服务提供商(TSP)必须在严苛的时间与成本限制下,交付满足客户规范且达到所需质量水平的大量翻译。MT 研究者力求改进其模型,这也需要可靠的质量评估。尽管自动机器翻译评估(MTE)指标和质量估计(QE)工具广泛可用且易于获取,现有自动化工具仍不够好,专业译员的人工评估(HAP)常被选为黄金标准 \cite{han-etal-2021-TQA}。然而,人工评估常被指责可靠性和一致性低。这是由主观性导致的,还是统计规律在起作用?如何从成本与效率角度避免检查整篇文本、在 TQE 上更高效,以及翻译文本的 optimal 样本量是多少,从而可靠地估计整体材料的翻译质量?本工作开展了此项动机研究,以根据翻译文本的样本量(如词或句的数量)正确估计置信区间 \cite{Brown_etal2001Interval},该样本量是在 TQE 工作流程步骤中需要处理以对整体翻译质量进行可信可靠评估的量。我们应用于本工作的方法来自伯努利统计分布建模(BSDM)和蒙特卡洛抽样分析(MCSA)。

关键词

引用

@article{arxiv.2111.07699,
  title  = {Measuring Uncertainty in Translation Quality Evaluation (TQE)},
  author = {Serge Gladkoff and Irina Sorokina and Lifeng Han and Alexandra Alekseeva},
  journal= {arXiv preprint arXiv:2111.07699},
  year   = {2021}
}

备注

13 pages, 9 figures