中文

惯用语检测的少样本高效方法

计算与语言 2022-05-24 v1

摘要

深度神经模型,特别是基于 Transformer 的预训练语言模型,需要大量数据进行训练。这种数据需求在处理惯用多词表达式(MWE)时往往引发问题,因为后者在自然文本中固有地较少出现。因此,本工作探索惯用语检测的少样本高效方法。我们尤其研究了 Pattern Exploit Training(PET,一种少样本分类方法)与 BERTRAM(一种高效的上下文嵌入创建方法)在惯用语检测任务上的影响。此外,为进一步探究泛化能力,我们聚焦于识别训练数据中未出现的 MWE。实验表明,尽管这些方法在英语上提升了性能,但在葡萄牙语和加利西亚语上效果不佳,总体表现与 vanilla mBERT 大致相当。即便如此,我们认为用于识别和表示潜在惯用 MWE 的少样本高效方法极具前景,并为未来探索具有重要潜力。

关键词

引用

@article{arxiv.2205.11306,
  title  = {Sample Efficient Approaches for Idiomaticity Detection},
  author = {Dylan Phelps and Xuan-Rui Fan and Edward Gow-Smith and Harish Tayyar Madabushi and Carolina Scarton and Aline Villavicencio},
  journal= {arXiv preprint arXiv:2205.11306},
  year   = {2022}
}