中文

维吉尼亚距离:基准任务相似性度量

计算与语言 2024-02-27 v2 人工智能 机器学习

摘要

评估在现代自然语言处理中发挥着重要作用。大多数现代 NLP 基准测试由任意组成的任务集合构成,这些任务既不保证在测试集之外的应用时模型的泛化潜力,也不尝试最小化模型评估所需的资源消耗。本文提出了一种理论工具和实用算法,用于计算基准任务之间的相似性,我们将这种相似性度量称为“维吉尼亚距离”。该相似性度量的核心思想是基于“学生”在给定任务上的相对表现,而非任务本身的属性。如果两个任务在维吉尼亚距离上彼此接近,模型在它们上的相对表现倾向于相似。因此,仅通过了解任务之间的维吉尼亚距离,就可以在保持高验证质量的同时,显著减少评估任务的数量。在包括 GLUE、SuperGLUE、CLUE 和 RussianSuperGLUE 在内的 various基准测试上的实验表明,绝大多数 NLP 基准测试的任务数量至少可以缩减 40%。更重要的是,维吉尼亚距离还可用于新任务的验证,从而提高未来 NLP 模型的泛化潜力。

关键词

引用

@article{arxiv.2402.14890,
  title  = {Vygotsky Distance: Measure for Benchmark Task Similarity},
  author = {Maxim K. Surkov and Ivan P. Yamshchikov},
  journal= {arXiv preprint arXiv:2402.14890},
  year   = {2024}
}