基于Transformer模型的多词表达式语义:综述
计算与语言
2024-01-30 v1
摘要
多词表达式(MWE)由多个词组成,并表现出不同程度的组合性。因此,其含义出了名地难以建模,且尚不清楚该问题在多大程度上影响Transformer架构。为弥补这一空白,我们首次对Transformer模型处理MWE的情况进行了深入综述。总体而言,我们发现它们对MWE语义的捕捉并不一致,这表现在对表面模式和记忆信息的依赖上。MWE的含义也具有强烈的局部性,主要集中在架构的早期层。表征得益于特定的语言属性,如目标表达式较低的语义特异性和歧义性。我们的总体发现质疑了Transformer模型稳健捕捉细粒度语义的能力。此外,我们强调了需要更多可直接比较的评估设置。
引用
@article{arxiv.2401.15393,
title = {Semantics of Multiword Expressions in Transformer-Based Models: A Survey},
author = {Filip Miletić and Sabine Schulte im Walde},
journal= {arXiv preprint arXiv:2401.15393},
year = {2024}
}
备注
Accepted to TACL 2024. This is a pre-MIT Press publication version