中文

利用 HEROS 揭示句子编码器评价的盲区

计算与语言 2023-06-14 v2

摘要

现有句子文本相似度基准数据集仅用单一数值来概括句子编码器(SE)决策与人类判断的相似程度。然而,尚不清楚句子编码器会将何种句子对视为相似。此外,现有 SE 基准主要考虑低词汇重叠的句子对,因此当两句具有高词汇重叠时 SE 的行为并不明确。我们引入了高质量 SE 诊断数据集 HEROS。HEROS 通过基于特定规则将原句变换为新句以构成具有高度词汇重叠的极小对(minimal pair)来构建。规则包括将词替换为同义词、反义词、错别字、随机词,以及将原句转换为其否定形式。不同规则产生 HEROS 的不同子集。通过系统比较 60 余个有监督与无监督 SE 在 HEROS 上的表现,我们揭示出大多数无监督句子编码器对否定不敏感。我们发现训练 SE 所用数据集是决定 SE 将何种句子对视为相似的主要因素。我们还表明,即便两个 SE 在 STS 基准上表现相近,它们在 HEROS 上行为可能迥异。我们的结果揭示了传统 STS 基准在评价 SE 时的盲区。

关键词

引用

@article{arxiv.2306.05083,
  title  = {Revealing the Blind Spot of Sentence Encoder Evaluation by HEROS},
  author = {Cheng-Han Chiang and Yung-Sung Chuang and James Glass and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2306.05083},
  year   = {2023}
}

备注

ACL 2023 repl4nlp (representation learning for NLP) workshop poster paper. Dataset at https://huggingface.co/datasets/dcml0714/Heros