DeepDiveAI:从大规模文献数据中识别与AI相关文档的方法
人工智能
2025-04-23 v5
摘要
本文提出了一种自动从大规模文献数据库中分类AI相关文档的方法,构建了一个名为DeepDiveAI的AI相关文献数据集。该数据集构建方法将专家知识与先进模型的能力相结合,贯穿两个全局阶段。在第一阶段,使用专家精选的分类数据集训练LSTM模型,对大规模数据集中的粗糙AI相关记录进行分类。在第二阶段,我们使用Qwen2.5 Plus对粗糙AI相关记录中随机抽取的10%进行标注,然后用于训练BERT二分类器。该步骤进一步细化了粗糙AI相关记录集合,以获得最终的DeepDiveAI数据集。评估结果表明,该整个工作流程能够高效准确地从大规模数据集中识别AI相关文献。
引用
@article{arxiv.2408.12871,
title = {DeepDiveAI: Identifying AI Related Documents in Large Scale Literature Data},
author = {Zhou Xiaochen and Liang Xingzhou and Zou Hui and Lu Yi and Qu Jingjing},
journal= {arXiv preprint arXiv:2408.12871},
year = {2025}
}