HardMTBench:压力测试中文-英文翻译上的知识密集型领域
计算与语言
2026-05-28 v1
摘要
通用机器翻译基准如 FLORES-200 在中文-英文对上已进入饱和 regime,其中现代大型语言模型在评分上聚集在狭窄的高分区间。跨 22 系统,FLORES-200 zh-en GEMBA 分数落在 7.87 分的范围内,标准差为 2.29,这压缩了知识密集型领域(如金融、医疗、法律和科学技术)之间的系统间的分离。我们引入 HardMTBench,这是一个面向双向中文-英文领域翻译的难度感知诊断基准。HardMTBench 涵盖 12 个领域,包含 10,000 条人工精选源句及其参考译文,构成 20,000 条方向性测试项。三个阶段的构建流程构建了 84,566 对的领域平衡候选池,应用基于 LLM 的多信号判官评估知识密度、翻译难度、术语负载和参考正确性,并在每个领域配额下依据硬度融合规则组装最终测试集。跨 22 系统(包括通用 LLM、商业引擎和专用 MT 模型),HardMTBench 将与 FLORES-200 相比的跨系统 GEMBA 范围扩大约为原来的一倍,引发可见的排名重排序,并暴露出质量唯一指标倾向于平滑化的领域特定术语和知识弱点。所有数据和代码均开源于 https://github.com/jasonNLP/HardMTBench。
引用
@article{arxiv.2605.28315,
title = {HardMTBench: Stress-Testing Chinese-English Translation on Knowledge-Intensive Domains},
author = {Zheng Li and Mao Zheng and Mingyang Song and Tianxiang Fei},
journal= {arXiv preprint arXiv:2605.28315},
year = {2026}
}