中文

infoVerse:一种基于多维元信息的通用数据集刻画框架

计算与语言 2023-06-13 v2

摘要

NLP系统的成功往往依赖于大规模高质量数据集的可用性。然而,这些数据集中的样本并非都对学习具有同等价值,因为有些可能冗余或含噪。基于模型驱动的元信息(例如模型置信度)刻画数据集的若干方法已被开发,但这些方法之间的关系与互补效应较少受到关注。本文中,我们引入infoVerse,一种用于数据集刻画的通用框架,它通过融合各种模型驱动的元信息,提供一个有效捕捉数据集多维特征的新特征空间。infoVerse揭示了在原始语义空间中不明显的独特数据区域,从而引导用户(或模型)识别应重点关注以进行探索、评估或标注的样本。此外,我们提出一种在infoVerse上的新颖采样方法,以选择一组信息量最大的数据点。在三个真实世界应用(数据剪枝、主动学习和数据标注)中,在infoVerse空间上选取的样本在所有应用中持续优于强基线。我们的代码与演示已公开可用。

关键词

引用

@article{arxiv.2305.19344,
  title  = {infoVerse: A Universal Framework for Dataset Characterization with Multidimensional Meta-information},
  author = {Jaehyung Kim and Yekyung Kim and Karin de Langis and Jinwoo Shin and Dongyeop Kang},
  journal= {arXiv preprint arXiv:2305.19344},
  year   = {2023}
}

备注

26 pages, accepted at ACL 2023 conference as a full paper