arXiv.org 上的科学陈述分类
计算与语言
2025-03-21 v1 人工智能
数字图书馆
摘要
我们提出了一种新的科学陈述分类任务,并发布了一个用于监督学习的大规模数据集。我们的资源来源于 arXiv.org 预印本文章集合的可机器读取表示。我们探讨了五十个作者标注的类别,并从经验上论证了将 1050 万带标注段落分组为十三个类别的任务设计。我们证明该任务设置与已知的最先进成果成功率一致,通过 BiLSTM 编码器-解码器模型达到峰值 0.91 的 F1 分数。此外,我们引入了数学公式的词素序列化方法,并观察到当上下文感知模型同时在符号模态上训练时性能可得到提升。最后,我们讨论了数据和任务设计的局限性,并勾勒出超越孤立陈述、朝向日益复杂的科学话语模型的潜在方向。
引用
@article{arxiv.1908.10993,
title = {Scientific Statement Classification over arXiv.org},
author = {Deyan Ginev and Bruce R. Miller},
journal= {arXiv preprint arXiv:1908.10993},
year = {2025}
}