BigBIO:面向数据中心化生物医学自然语言处理的框架
计算与语言
2022-07-01 v1
摘要
语言模型的训练与评估日益需要构建元数据集——具有清晰来源、经过整理的多样化数据集合。自然语言提示近期通过将已有的监督数据集转化为多种新颖的预训练任务,提升了零样本泛化能力,凸显了元数据集整理的优势。尽管这些方法在通用领域文本中取得成功,但将其迁移至生物医学语言建模仍具挑战,因为主流数据平台中带标注的生物医学数据集严重代表性不足。为应对此挑战,我们推出 BigBIO,一个包含 126 余个生物医学 NLP 数据集的社区库,目前覆盖 12 个任务类别和 10 余种语言。BigBIO 通过程序化访问数据集及其元数据,促进可复现的元数据集整理,并兼容当前的提示工程与端到端少/零样本语言模型评测平台。我们讨论了任务模式统一、数据审计、贡献指南的流程,并概述了两个示例用例:生物医学提示的零样本评测与大规模多任务学习。BigBIO 是一项持续的社区工作,可通过 https://github.com/bigscience-workshop/biomedical 获取。
引用
@article{arxiv.2206.15076,
title = {BigBIO: A Framework for Data-Centric Biomedical Natural Language Processing},
author = {Jason Alan Fries and Leon Weber and Natasha Seelam and Gabriel Altay and Debajyoti Datta and Samuele Garda and Myungsun Kang and Ruisi Su and Wojciech Kusa and Samuel Cahyawijaya and Fabio Barth and Simon Ott and Matthias Samwald and Stephen Bach and Stella Biderman and Mario Sänger and Bo Wang and Alison Callahan and Daniel León Periñán and Théo Gigant and Patrick Haller and Jenny Chim and Jose David Posada and John Michael Giorgi and Karthik Rangasai Sivaraman and Marc Pàmies and Marianna Nezhurina and Robert Martin and Michael Cullan and Moritz Freidank and Nathan Dahlberg and Shubhanshu Mishra and Shamik Bose and Nicholas Michio Broad and Yanis Labrak and Shlok S Deshmukh and Sid Kiblawi and Ayush Singh and Minh Chien Vu and Trishala Neeraj and Jonas Golde and Albert Villanova del Moral and Benjamin Beilharz},
journal= {arXiv preprint arXiv:2206.15076},
year = {2022}
}
备注
Submitted to NeurIPS 2022 Datasets and Benchmarks Track