中文

基于Transformer模型的多词表达式语义:综述

计算与语言 2024-01-30 v1

摘要

多词表达式(MWE)由多个词组成,并表现出不同程度的组合性。因此,其含义出了名地难以建模,且尚不清楚该问题在多大程度上影响Transformer架构。为弥补这一空白,我们首次对Transformer模型处理MWE的情况进行了深入综述。总体而言,我们发现它们对MWE语义的捕捉并不一致,这表现在对表面模式和记忆信息的依赖上。MWE的含义也具有强烈的局部性,主要集中在架构的早期层。表征得益于特定的语言属性,如目标表达式较低的语义特异性和歧义性。我们的总体发现质疑了Transformer模型稳健捕捉细粒度语义的能力。此外,我们强调了需要更多可直接比较的评估设置。

关键词

引用

@article{arxiv.2401.15393,
  title  = {Semantics of Multiword Expressions in Transformer-Based Models: A Survey},
  author = {Filip Miletić and Sabine Schulte im Walde},
  journal= {arXiv preprint arXiv:2401.15393},
  year   = {2024}
}

备注

Accepted to TACL 2024. This is a pre-MIT Press publication version