中文

PET 的 MED:潜在委婉语的多语言委婉消歧

计算与语言 2024-01-29 v1

摘要

本研究探讨了委婉语这一普遍语言现象在多种语言中的计算处理。我们训练了一个多语言 Transformer 模型(XLM-RoBERTa),在多语言和跨语言环境中对潜在委婉语(PET)进行消歧。与当前趋势一致,我们证明了跨语言的零样本学习是可行的。我们还展示了多语言模型在任务上表现优于单语模型且具有统计显著性的案例,这表明多语言数据为模型学习委婉语的跨语言计算特性提供了额外机会。在后续分析中,我们重点关注了诸如死亡和身体功能等普遍委婉“类别”。我们测试了同一领域的跨语言数据是否比同一语言的其他领域数据更重要,以进一步理解跨语言迁移的本质。

关键词

引用

@article{arxiv.2401.14526,
  title  = {MEDs for PETs: Multilingual Euphemism Disambiguation for Potentially Euphemistic Terms},
  author = {Patrick Lee and Alain Chirino Trujillo and Diana Cuevas Plancarte and Olumide Ebenezer Ojo and Xinyi Liu and Iyanuoluwa Shode and Yuan Zhao and Jing Peng and Anna Feldman},
  journal= {arXiv preprint arXiv:2401.14526},
  year   = {2024}
}