中文

SenWiCh:使用混合方法为 WiC 标注低资源语言的词义

计算与语言 2025-07-23 v2 人工智能

摘要

本文探讨了低资源语言对高质量评估数据集的关键需求,以推进跨语言迁移。虽然跨语言迁移提供了一种利用多语言预训练将语言技术扩展到研究不足且类型多样的语言的关键策略,但其有效性取决于高质量且合适的基准。我们发布了包含多义词的句子词义标注数据集,涵盖不同语系和书写系统的十种低资源语言。为了便于数据集创建,本文提出了一种明显有益的半自动标注方法。通过 Word-in-Context (WiC) 格式的实验,评估了在这些低资源语言上的迁移,从而证明了这些数据集的实用性。结果突出了在低资源环境和迁移研究中,有针对性的数据集创建和评估对于有效多义消歧的重要性。发布的数据集和代码旨在支持对公平、稳健且真正多语言的自然语言处理 (NLP) 的进一步研究。

关键词

引用

@article{arxiv.2505.23714,
  title  = {SenWiCh: Sense-Annotation of Low-Resource Languages for WiC using Hybrid Methods},
  author = {Roksana Goworek and Harpal Karlcut and Muhammad Shezad and Nijaguna Darshana and Abhishek Mane and Syam Bondada and Raghav Sikka and Ulvi Mammadov and Rauf Allahverdiyev and Sriram Purighella and Paridhi Gupta and Muhinyia Ndegwa and Haim Dubossarsky},
  journal= {arXiv preprint arXiv:2505.23714},
  year   = {2025}
}

备注

8 pages, 22 figures, published at SIGTYP 2025 workshop in ACL