中文

高效科学全文分类:以EICAT影响评估为案例

计算与语言 2025-02-11 v1

摘要

本研究探讨了使用小型BERT模型和本地大型语言模型(如Llama-3.1 8B)对科学全文进行高效分类的策略。我们 focus on developing methods for selecting subsets of input sentences to reduce input size while simultaneously enhancing classification performance. 为此,我们构建了一个新的数据集,包含来自入侵生物学领域的完整科学论文,这些论文与国际自然保护联盟(IUCN)的公开影响评估相匹配。通过大量实验,我们展示了各种来源(如人类证据注释、LLM生成的注释或可解释性得分)可用于训练句子选择模型,以提升编码器和解码器基于语言模型的分类性能,同时通过减少输入长度来优化效率,即使与能够处理完整文本的ModernBERT模型相比较,也能获得 improved results。此外,我们发现反复抽取较短输入的策略在稍增加计算成本的同时,能够进一步提升分类性能。

关键词

引用

@article{arxiv.2502.06551,
  title  = {Efficient Scientific Full Text Classification: The Case of EICAT Impact Assessments},
  author = {Marc Felix Brinner and Sina Zarrieß},
  journal= {arXiv preprint arXiv:2502.06551},
  year   = {2025}
}