中文

翻译质量评估的非线性评分模型

计算与语言 2026-01-15 v4

摘要

基于多维质量指标(MQM)的分析性翻译质量评估(TQE)传统上使用线性错误-惩罚比例尺,对 1000-2000 字的参考样本进行校准。然而,线性外推会对不同大小的样本产生偏差,过度惩罚短样本,低估长样本,导致与专家直觉不一致。基于 Multi-Range 框架,本文提出了经过校准的非线性评分模型,更能反映人类内容消费者在不同样本大小下对翻译质量的感知。来自三个大型企业环境的经验数据显示,可接受错误计数随样本大小呈对数增长,而非线性增长。心理物理学和认知证据,包括韦伯-费曼定律和认知负荷理论,支持这一假设,解释了为何额外错误的感知影响随规模增长而减弱,而认知负担随规模增长。我们提出了一个两参数模型 E(x)=aln(1+bx)E(x) = a * \ln(1 + b * x),其中 a,b>0a, b > 0,锚定在参考容忍度上,并通过一个一维根寻找到两个容忍点进行校准。该模型给出线性近似保持在 +/-20% 相对误差内的显式区间,并仅通过添加动态容忍函数即可集成到现有评估工作流程中。该方法提高了可解释性、公平性和跨人类和 AI 生成翻译的评估可靠性。通过实现感知上有效的评分范式,该方法推动了翻译质量评估向更准确、更可扩展的评估迈进。该模型还为与人类判断力一致的 AI 生成文档级评估提供了更强的依据。讨论了面向 CAT/LQA 系统的实现考虑以及对人类和 AI 生成文本评估的含义。

关键词

引用

@article{arxiv.2511.13467,
  title  = {Non-Linear Scoring Model for Translation Quality Evaluation},
  author = {Serge Gladkoff and Lifeng Han and Katerina Gasova},
  journal= {arXiv preprint arXiv:2511.13467},
  year   = {2026}
}

备注

Technical report, 31 pages