好数据、大数据还是无数据?生物医学论文研究方面分类器开发的三种路径比较
计算与语言
2023-06-09 v1
摘要
科学文献的快速增长,尤其在COVID-19大流行期间,凸显了帮助研究者高效理解最新进展的工具之需求。理解科学文献的一个关键部分是研究方面分类,其将摘要中的句子归类为背景、目的、方法与发现。在本研究中,我们考察不同数据集对众包标注的CODA-19研究方面分类任务模型性能的影响。具体而言,我们探索使用大规模自动整理的PubMed 200K RCT数据集的潜在益处,并评估大语言模型(LLMs)(如LLaMA、GPT-3、ChatGPT与GPT-4)的有效性。我们的结果表明,使用PubMed 200K RCT数据集并未提升CODA-19任务的性能。我们还观察到,尽管GPT-4表现良好,其并未超越在CODA-19数据集上微调的SciBERT模型,这强调了针对目标任务的专用且与任务对齐的数据集之重要性。我们的代码见于https://github.com/Crowd-AI-Lab/CODA-19-exp。
引用
@article{arxiv.2306.04820,
title = {Good Data, Large Data, or No Data? Comparing Three Approaches in Developing Research Aspect Classifiers for Biomedical Papers},
author = {Shreya Chandrasekhar and Chieh-Yang Huang and Ting-Hao 'Kenneth' Huang},
journal= {arXiv preprint arXiv:2306.04820},
year = {2023}
}
备注
BioNLP workshop 2023