中文

调查词表示中的习语性

计算与语言 2024-11-06 v1 人工智能

摘要

习语表达是人类语言的重要组成部分,常以压缩或约定俗成的方式表达复杂概念(例如 eager beaver 指热情积极的人)。然而,其含义可能无法直接从各组成成分的独立含义中推导出来,这可能对组合式方法产生影响。本文研究了词表示模型在多大程度上能够超越组合式词组合,捕捉多词表达的习语性以及与习语含义相关的若干预期性质。我们聚焦于英语和葡萄牙语中不同习语程度的名词复合词,构建了一个最小对数据集,包含人类对每个名词复合词在类型和标记层面的习语性判断、其释义及其在自然语境和意义中性语境中的出现,共计32,200个句子。我们提出该最小对集合用于评估模型对习语含义的捕捉程度,并定义了一套细粒度的亲和度(Affinity)和缩放相似度(Scaled Similarity)指标,以衡量模型对可能导致习语性变化的扰动的敏感度。多种代表性且广泛使用的模型的实验结果表明,尽管表面上呈现出高相似度的反向迹象,习语性在当前模型中仍未得到准确表示。此外,不同语境化程度的模型性能表明,其语境捕捉能力尚无法超越词汇层面提供的表层线索,无法真正纳入习语性所需的相关语义线索。

关键词

引用

@article{arxiv.2411.02610,
  title  = {Investigating Idiomaticity in Word Representations},
  author = {Wei He and Tiago Kramer Vieira and Marcos Garcia and Carolina Scarton and Marco Idiart and Aline Villavicencio},
  journal= {arXiv preprint arXiv:2411.02610},
  year   = {2024}
}