中文

通过降低上下文语序排序实现高效零样本长文档分类

计算与语言 2025-08-26 v1 机器学习

摘要

基于 Transformer 的模型如 BERT 在短文本分类方面表现出色,但在长文档分类 (LDC) 中因输入长度限制和计算效率问题而受限。本文提出一种高效的零样本 LDC 方法,利用语序排序降低输入上下文,而无需修改模型架构。该方法使模型能够适配在短文本(如标题)上训练的模型,通过选择最具信息性的句子来实现。我们使用由马拉拉纳新闻长文章组成的 MahaNews 数据集,对比评估了三种上下文降低策略,这些策略在保持分类准确性的同时优先考虑关键内容。我们的结果表明,仅保留排名前 50\% 的句子即可维持与完整文档推断相当的性能,而推断时间可缩短最高 35\%。这表明语序排序是一种简单而有效的 scalable 和高效零样本 LDC 的技术。

关键词

引用

@article{arxiv.2508.17490,
  title  = {Efficient Zero-Shot Long Document Classification by Reducing Context Through Sentence Ranking},
  author = {Prathamesh Kokate and Mitali Sarnaik and Manavi Khopade and Mukta Takalikar and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2508.17490},
  year   = {2025}
}