清理科学出版物的英文摘要
计算与语言
2026-01-01 v1
摘要
科学摘要常被用作研究出版物内容和主题焦点的代理。然而,相当一部分已发表的摘要包含无关信息——例如出版商版权声明、章节标题、作者注释、注册信息以及文献计量或书目元数据——这些信息可能会扭曲下游分析,特别是那些涉及文档相似性或文本嵌入的分析。我们引入了一个开源、易于集成的语言模型,旨在通过自动识别和移除此类杂乱信息来清理英文科学摘要。我们证明,我们的模型既保守又精确,能够改变清理后摘要的相似性排名,并提高标准长度嵌入的信息内容。
引用
@article{arxiv.2512.24459,
title = {Cleaning English Abstracts of Scientific Publications},
author = {Michael E. Rose and Nils A. Herrmann and Sebastian Erhardt},
journal= {arXiv preprint arXiv:2512.24459},
year = {2026}
}
备注
2 tables, 2 figures