中文

面向低资源形态学变形的自监督目标提升

人机交互 2025-06-06 v1

摘要

自监督目标已通过利用大规模无标签数据推动 NLP 领域的重大进展,但许多语言的此类资源较为稀缺。令人惊讶的是,这些目标在字符级任务中鲁能被充分探索,而字符级任务在数据量较小的情况下潜在具有优势。我们探讨了在极端低资源环境下使用自监督辅助任务来提高形态学变形性能——这是与字符级任务高度相关的任务,训练 19 种语言和 13 种辅助目标的编码器-解码器 transformer。自编码器在无标签数据非常有限时表现最佳,而字符掩码语言模型(CMLM)随数据可得性增加而更有效。尽管具有更强归纳偏置的目标在直观上会影响模型预测,但它们很少超过标准 CMLM。然而,基于已知形态边界对掩码进行采样始终能显著改善性能,这凸显了低资源形态学建模的有前景的方向。

关键词

引用

@article{arxiv.2506.05226,
  title  = {Towards Effective Multidisciplinary Health and HCI Teams based on AI Framework},
  author = {Mohammed Almutairi and Diego Gómez-Zará},
  journal= {arXiv preprint arXiv:2506.05226},
  year   = {2025}
}

备注

4 pages, 1 figure, Presented at CHI24, Workshop on Conducting Research at the Intersection of HCI and Health Building and Supporting Teams with Diverse Expertise to Increase Public Health Impact, May 11 to 16, 2024, Honolulu, HI, USA