基于大语言模型的论文来源追溯集成学习:无 GPU 方法
机器学习
2024-09-18 v2 人工智能
计算与语言
摘要
我们参赛于 KDD CUP 2024 论文来源追溯竞赛,获得第三名。这一竞赛要求参赛者识别给定学术论文的参考来源(即作为组织方所称的 ref-sources)。与大多数采用微调预训练神经语言模型如 BERT 或 ChatGLM 解决此挑战的团队不同,我们的主要方法利用闭源大语言模型(LLMs)。随着 LLM 技术的最新进展,闭源 LLMs 在零样本或少样本场景下已展现出处理复杂推理任务的能力。因此,在缺乏 GPU 的情况下,我们采用闭源 LLMs 直接从提供的论文中生成预测的参考来源。我们进一步通过集成学习细化这些预测。值得注意的是,我们的方法是获奖方法中唯一一个不需要进行模型训练即可使用的方案。代码地址:https://github.com/Cklwanfifa/KDDCUP2024-PST。
引用
@article{arxiv.2409.09383,
title = {LLM-Powered Ensemble Learning for Paper Source Tracing: A GPU-Free Approach},
author = {Kunlong Chen and Junjun Wang and Zhaoqun Chen and Kunjin Chen and Yitian Chen},
journal= {arXiv preprint arXiv:2409.09383},
year = {2024}
}