中文

跨语言迁移还是机器翻译?关于单语语义文本相似性的数据增强

计算与语言 2024-03-11 v1

摘要

学习更好的句子嵌入可以提升包括语义文本相似性 (STS) 和自然语言推理 (NLI) 在内的自然语言理解任务的性能。由于先前的研究利用大规模标注 NLI 数据集对掩码语言模型进行微调以生成句子嵌入,导致英语以外语言的任务性能往往落后。在本研究中,我们直接比较了两种作为单语 STS 潜在解决方案的数据增强技术:(a) 仅利用英语资源作为训练数据以产生非英语句子嵌入并进行零样本推理的跨语言迁移,以及 (b) 预先将英语数据转换为伪非英语训练数据的机器翻译。我们在日语和韩语的单语 STS 实验中发现,这两种数据技术产生的性能相当。相反,我们发现对于这些语言,维基百科领域优于 NLI 领域,这与先前专注于将 NLI 作为训练数据的研究形成对比。结合我们的发现,我们证明了维基百科数据的跨语言迁移表现出更好的性能,且原生维基百科数据可以进一步提升单语 STS 的性能。

关键词

引用

@article{arxiv.2403.05257,
  title  = {Cross-lingual Transfer or Machine Translation? On Data Augmentation for Monolingual Semantic Textual Similarity},
  author = {Sho Hoshino and Akihiko Kato and Soichiro Murakami and Peinan Zhang},
  journal= {arXiv preprint arXiv:2403.05257},
  year   = {2024}
}

备注

LREC-COLING 2024