中文

生成式 AI 在科研数据处理中的应用:来自三个案例的经验教训

人工智能 2025-04-23 v1

摘要

自 2022 年 ChatGPT 发布以来,生成式 AI 产生了巨大的兴趣,但也存在输出准确性和一致性方面的顾虑。我们对该新技术在科研数据处理中的应用进行了探索性研究。我们识别了规则方法或传统机器学习方法难以应用的任务,然后使用生成式 AI 完成这些任务。我们展示了在三个涉及复杂数据处理任务的科研项目中使用生成式 AI 模型 Claude 3 Opus 的可行性:1)信息提取:我们从由植物学园林发布的历史种子清单中提取植物种名。2)自然语言理解:我们从欧盟健康技术评估组织发布的文档中提取特定数据点(药物名称、健康指征名称、相对有效性、成本效益等)。3)文本分类:我们将 Kickstarter 众筹网站上的项目分配到行业代码。我们分享了从这些案例中获得的经验教训:如何确定生成式 AI 是否适合给定的数据处理任务,以及如果是的话,如何最大化获得的结果的准确性和一致性。

关键词

引用

@article{arxiv.2504.15829,
  title  = {Generative AI for Research Data Processing: Lessons Learnt From Three Use Cases},
  author = {Modhurita Mitra and Martine G. de Vos and Nicola Cortinovis and Dawa Ometto},
  journal= {arXiv preprint arXiv:2504.15829},
  year   = {2025}
}

备注

10 pages, 4 figures, 6 tables. Published in Proceedings of the 2024 IEEE 20th International Conference on e-Science (e-Science), Osaka, Japan