刻画 NLP 语料距离度量的“分布性”程度
计算与语言
2023-10-24 v1 应用统计
摘要
向量嵌入文本文档的语料具有某种经验分布。给定两个语料,我们希望计算它们之间的单一距离度量(例如 Mauve、Frechet Inception)。我们描述此类度量的一种抽象性质,称为“分布性”。非分布性度量倾向于使用非常局部的测量,或以未能充分反映分布真实距离的方式使用全局测量。例如,若个体两两最近邻距离较低,它可能判定两个语料距离较小,即使它们的两个分布实际上相距甚远。相反,更具分布性的度量能更好地捕捉分布的整体距离。我们通过从两个释义语料构建已知相似度语料集并计算其中配对语料间的距离来量化该性质。随着集合元素分离度增大,距离的趋势形状应量化该度量的分布性。我们提出语料间的平均豪斯多夫距离与能量距离分别是非分布性与分布性距离度量的代表性示例,其他度量可与之比较以评估其分布性程度。
引用
@article{arxiv.2310.14829,
title = {Characterizing how 'distributional' NLP corpora distance metrics are},
author = {Samuel Ackerman and George Kour and Eitan Farchi},
journal= {arXiv preprint arXiv:2310.14829},
year = {2023}
}
备注
Published in the August 2023 Joint Statistical Meetings proceedings