中文

用于自然语言处理与生成中数据集和模型文档化的可复用模板与指南:以 HuggingFace 与 GEM 数据和模型卡片为例

数据库 2021-08-18 v1 计算与语言

摘要

为数据集和模型开发文档指南及易用模板是一项具有挑战性的任务,尤其是考虑到参与构建自然语言处理(NLP)工具的人员背景、技能和动机的多样性。尽管如此,NLP 领域采用标准文档实践有助于提供更易获取且详尽的数据集与模型描述,同时帮助研究人员和开发者反思其工作。为助力文档标准化,我们呈现了两个旨在开发可复用文档模板的案例研究——HuggingFace 数据卡片(一种用于 NLP 数据集的通用卡片)以及专注于自然语言生成的 GEM 基准数据与模型卡片。我们描述了开发这些模板的过程,包括识别相关利益群体、定义一组指导原则、以现有模板为基础,以及基于反馈的迭代修订。

关键词

引用

@article{arxiv.2108.07374,
  title  = {Reusable Templates and Guides For Documenting Datasets and Models for Natural Language Processing and Generation: A Case Study of the HuggingFace and GEM Data and Model Cards},
  author = {Angelina McMillan-Major and Salomey Osei and Juan Diego Rodriguez and Pawan Sasanka Ammanamanchi and Sebastian Gehrmann and Yacine Jernite},
  journal= {arXiv preprint arXiv:2108.07374},
  year   = {2021}
}

备注

15 pages; in Proceedings of the 1st Workshop on Natural Language Generation, Evaluation, and Metrics (GEM 2021)