中文

RepMatch:度量表示空间中的跨实例相似性

计算与语言 2024-10-15 v1

摘要

数据集分析技术的进展使得更精细的方法能够分析和表征训练数据实例,通常根据诸如“困难程度”等属性对数据进行分类。在本 work 中,我们引入了 RepMatch,这是一种新方法,通过比较在不同子集上训练的模型所编码的知识来表征数据,克服了现有分析方法仅关注单个实例且局限于数据集内部分析的限制。我们的框架允许更广泛的评估,支持对任意子集实例的相似性比较,支持数据集-数据集和实例-数据集分析。我们在多个 NLP 任务、数据集和模型上验证了 RepMatch 的有效性。通过大量实验,我们展示了 RepMatch 能够有效比较数据集、识别更具代表性的数据集子集(这些子集比相同大小的随机子集表现更好),并揭示了构建某些挑战数据集背后的启发式方法。

关键词

引用

@article{arxiv.2410.09642,
  title  = {RepMatch: Quantifying Cross-Instance Similarities in Representation Space},
  author = {Mohammad Reza Modarres and Sina Abbasi and Mohammad Taher Pilehvar},
  journal= {arXiv preprint arXiv:2410.09642},
  year   = {2024}
}