出其不意:相似度得分的对比效应
计算与语言
2023-08-23 v2 人工智能
信息检索
机器学习
摘要
准确评估对象向量嵌入的相似性对自然语言处理、信息检索和分类任务至关重要。流行的相似度得分(例如余弦相似度)基于成对的嵌入向量,而忽略了对象所取自整体的分布。人类的对象相似性感知显著依赖于对象出现的语境。在本工作中,我们提出 (惊奇得分),一种集合归一化的相似性度量,它封装了人类感知的对比效应,并显著提升了零样本和少样本文档分类任务的分类性能。该得分量化了相对于成对整体相似性发现两个元素间给定相似性的惊奇程度。我们在零样本/少样本分类和聚类任务上评估了该度量,通常发现比原始余弦相似度好 10-15% 的性能。我们的代码可在 https://github.com/MeetElise/surprise-similarity 获取。
引用
@article{arxiv.2308.09765,
title = {Taken by Surprise: Contrast effect for Similarity Scores},
author = {Thomas C. Bachlechner and Mario Martone and Marjorie Schillo},
journal= {arXiv preprint arXiv:2308.09765},
year = {2023}
}
备注
9 pages, 2 figures and 4 tables