中文

中文社交媒体文本机器翻译基准测试

计算与语言 2026-02-02 v1

摘要

快速演化的俚语、新词以及高度风格化表达的流行于中文社交媒体中的非正式用户生成文本,为机器翻译(MT)基准测试带来重大挑战。具体而言,我们识别出两个主要障碍:(1)数据稀缺,因高质量平行数据需要熟悉平台特定俚语的双语标注者,且两语中都包含风格线索;(2)指标局限,传统评估者如 COMET 常常难以捕捉风格忠实性和非标准表达。为弥合这两方面的差距,我们引入 CSM-MTBench,一个覆盖五种中文-外语方向的基准,包含两个由专家精选的子集:Fun Posts 侧重于富有上下文、包含大量俚语和新词的内容;Social Snippets 强调简洁、情感和风格驱动的表达。进一步,我们为每个子集提出了量身定制的评估方法:在 Fun Posts 中衡量俚语和新词的翻译成功率;在 Social Snippets 中通过嵌入基指标和 LLM 评判器的混合方法,评估语气与风格的保留情况。在超过 20 个模型的实验中,我们发现当前 MT 系统在处理语义忠实性和非正式、社交媒体特定风格线索方面存在显著差异。CSM-MTBench 因此作为推进能够掌握真实中文社交媒体文本的 MT 系统的严格测试台。

关键词

引用

@article{arxiv.2601.22931,
  title  = {Benchmarking Machine Translation on Chinese Social Media Texts},
  author = {Kaiyan Zhao and Zheyong Xie and Zhongtao Miao and Xinze Lyu and Yao Hu and Shaosheng Cao},
  journal= {arXiv preprint arXiv:2601.22931},
  year   = {2026}
}

备注

Work in Progress