中文

LimTopic:基于 LLM 的科学文章局限性主题建模与文本摘要

计算与语言 2025-03-17 v1 机器学习

摘要

科学文章的局限性章节在突出研究边界和不足之处、指导未来研究和改进研究方法方面发挥着关键作用。分析这些局限性对研究者、评审员、资助机构和更广泛的学术社区都有益处。我们提出 LimTopic 方法,通过大型语言模型 (LLM) 对科学文章的局限性章节进行主题生成。每个主题包含标题和主题摘要。本研究聚焦于通过主题建模和文本摘要有效提取和理解这些局限性,利用 LLM 的能力。我们从研究文章中提取局限性,使用基于 LLM 的主题建模集成 BERtopic 方法为每个主题生成标题和主题句子。为增进理解和可及性,我们采用 LLM 基于文本摘要技术,为每个主题的主题句子创建简洁且可概括的摘要,并生成主题摘要。我们的实验包括提示工程、微调 LLM 和 BERTopic,以及整合 BERTopic 与 LLM 以生成主题、标题和主题摘要。我们还实验了 various LLMs with BERTopic 进行主题建模以及 various LLMs 进行文本摘要任务。我们的结果显示,BERTopic 与 GPT-4 的组合在主题建模的轮廓系数和一致性分数方面表现最佳,GPT-4 摘要在文本摘要任务中超过其他 LLM。

关键词

引用

@article{arxiv.2503.10658,
  title  = {LimTopic: LLM-based Topic Modeling and Text Summarization for Analyzing Scientific Articles limitations},
  author = {Ibrahim Al Azhar and Venkata Devesh Reddy and Hamed Alhoori and Akhil Pandey Akella},
  journal= {arXiv preprint arXiv:2503.10658},
  year   = {2025}
}

备注

12 pages, accepted at JCDL 2024 (The ACM/IEEE Joint Conference on Digital Libraries). This is a preprint version; the final version will be published in the ACM Digital Library