中文

评估与提升英-马拉地语机器翻译中的标点鲁棒性

计算与语言 2026-02-16 v3

摘要

神经机器翻译(Neural Machine Translation, NMT)系统严重依赖显式标点线索来消除源语句中的语义歧义。输入用户生成的句子(这些句子很可能包含缺失或错误的标点)会导致翻译流利但语义上存在严重错误。本工作试图通过英译马拉地语来揭示并解决 NMT 系统的标点鲁棒性问题。首先,我们引入了 **Viram**,一个由人工整理的、包含 54 对存在标点歧义的英-马拉地语句子的诊断基准,用于对现有 NMT 系统进行压力测试。其次,我们评估了两种简单的修复策略:基于级联的“先恢复后翻译”和“直接微调”。我们的实验结果和分析表明,这两种策略都能显著提升 NMT 的性能。此外,我们发现当前的大语言模型(Large Language Models, LLMs)在翻译此类句子时,其鲁棒性相对弱于这些任务特定策略,因此需要在该领域进行进一步研究。代码和数据集可在 https://github.com/KaustubhShejole/Viram_Marathi 获取。

关键词

引用

@article{arxiv.2601.09725,
  title  = {Assessing and Improving Punctuation Robustness in English-Marathi Machine Translation},
  author = {Kaustubh Shivshankar Shejole and Sourabh Deoghare and Pushpak Bhattacharyya},
  journal= {arXiv preprint arXiv:2601.09725},
  year   = {2026}
}