中文

DataFinder:基于自然语言描述的科学数据集推荐

信息检索 2023-06-08 v2 计算与语言 数字图书馆

摘要

现代机器学习依赖数据集来发展和验证研究想法。随着公开可用数据的增长,找到合适的数据集使用愈发困难。任何研究问题都对给定数据集能在多大程度上帮助研究者回答该问题施加了显式与隐式约束,例如数据集规模、模态和领域。我们将给定研究想法的简短自然语言描述来推荐数据集的任务操作化,以帮助人们找到满足其需求的相关数据集。数据集推荐作为信息检索问题面临独特挑战;数据集难以直接建立索引以供搜索,且尚无现成语料可用于此任务。为促进该任务,我们构建了 DataFinder Dataset,其包含一个较大的自动构建训练集(17.5K 查询)和一个较小的专家标注评估集(392 查询)。利用该数据,我们在测试集上比较了多种信息检索算法,并提出了一种用于基于文本的数据集推荐的更优双编码器检索器。该系统在 DataFinder Dataset 上训练,比现有第三方数据集搜索引擎找到更相关的搜索结果。为鼓励数据集推荐方面的进展,我们向公众发布我们的数据集与模型。

关键词

引用

@article{arxiv.2305.16636,
  title  = {DataFinder: Scientific Dataset Recommendation from Natural Language Descriptions},
  author = {Vijay Viswanathan and Luyu Gao and Tongshuang Wu and Pengfei Liu and Graham Neubig},
  journal= {arXiv preprint arXiv:2305.16636},
  year   = {2023}
}

备注

To appear at ACL 2023. Code published at https://github.com/viswavi/datafinder