中文

Pralekha:印度语言的跨语言文档对齐

计算与语言 2025-11-11 v3

摘要

挖掘文档级机器翻译(MT)所需的平行文档对仍具有挑战性,由于现有跨语言文档对齐(CLDA)技术的局限性。现有方法常依赖诸如URL等元数据,而这些元数据稀缺,或基于汇聚文档表示,难以捕获细粒度的对齐线索。此外,句子嵌入模型的有限上下文窗口限制了其捕获文档级上下文的能力,而基于句子的对齐则引入了组合爆炸式的搜索空间,导致高计算成本。为解决印度语言的这些挑战,我们引入Pralekha,一个包含超过300万个跨越11种印度语言和英语的对齐文档对基准,包括150万个英语-印度语言对。进一步,我们提出了文档对齐系数(DAC)这一新型指标,用于细粒度文档对齐。与汇聚式方法不同,DAC通过匹配较小块来对齐文档,并计算为对齐块数与文档对平均块数的比值。针对性评估显示,我们的块式方法在保持竞争性能的同时速度提升2-3倍,DAC相对于汇聚式基线实现了显著提升。外在评估进一步表明,使用DAC对齐的文档级MT模型在一致性上优于基于基线对齐方法的模型。这些结果凸显了DAC在平行文档挖掘中的有效性。该数据集和评估框架已公开,以支持进一步的研究。

关键词

引用

@article{arxiv.2411.19096,
  title  = {Pralekha: Cross-Lingual Document Alignment for Indic Languages},
  author = {Sanjay Suryanarayanan and Haiyue Song and Mohammed Safi Ur Rahman Khan and Anoop Kunchukuttan and Raj Dabre},
  journal= {arXiv preprint arXiv:2411.19096},
  year   = {2025}
}