TaxoAdapt:将基于LLM的多维分类体系构建与演化研究语料库对齐
计算与语言
2025-06-13 v1 信息检索
摘要
科学领域的快速演化给科学文献的组织与检索带来了挑战。虽然专家策划的分类体系传统上解决了这一需求,但该过程耗时且昂贵。此外,近期的自动分类体系构建方法要么(1)过度依赖特定语料库,牺牲了泛化能力,要么(2)严重依赖大型语言模型(LLM)预训练数据集中包含的通用知识,往往忽视了演化科学领域的动态特性。此外,这些方法未能考虑科学文献的多面性,其中单篇研究论文可能贡献于多个维度(如方法、新任务、评估指标、基准)。为解决这些空白,我们提出了TaxoAdapt,一个将LLM生成的分类体系动态适配到给定语料库的多维框架。TaxoAdapt执行迭代层次分类,根据语料库的主题分布同时扩展分类体系的宽度和深度。我们在一组多样化的计算机科学会议中展示了其最先进性能,以展示其结构化和捕捉科学领域演化的能力。作为一种多维方法,TaxoAdapt生成的分类体系在粒度保持方面比最具竞争力的基线高出26.51%,在连贯性方面高出50.41%,由LLM评判。
引用
@article{arxiv.2506.10737,
title = {TaxoAdapt: Aligning LLM-Based Multidimensional Taxonomy Construction to Evolving Research Corpora},
author = {Priyanka Kargupta and Nan Zhang and Yunyi Zhang and Rui Zhang and Prasenjit Mitra and Jiawei Han},
journal= {arXiv preprint arXiv:2506.10737},
year = {2025}
}
备注
Accepted to ACL 2025 Main Conference. Code available at: https://github.com/pkargupta/taxoadapt