中文

超越 Token 限制:评估语言模型在长文本分类上的性能

计算与语言 2025-09-30 v3

摘要

社会科学领域最广泛使用的大语言模型(如 BERT 及其衍生模型,例如 RoBERTa)在可处理的输入文本长度上存在限制,这会影响其生成预测。对于旨在处理长输入文本的某些分类任务而言,这是一个尤为紧迫的问题。法律和法律草案(法案)领域便是其中之一,其文本可达数百页,因此并不适合用仅能处理如 512 个 token 的模型来处理。本文展示了涵盖 5 种语言、使用 XLM-RoBERTa、Longformer、GPT-3.5 和 GPT-4 模型在 Comparative Agendas Project 多类分类任务上的实验结果,该项目包含一个从教育到医疗的 21 个政策主题标签的编码手册。结果显示,专门为处理长输入而预训练的 Longformer 模型并未表现出特别优势。将 GPT 变体与性能最佳的开源模型进行比较后发现,后者更具优势。对类别级因素的分析表明,在处理长文本输入时,特定类别之间的支持度与实质重叠度对性能具有重要影响。

关键词

引用

@article{arxiv.2509.10199,
  title  = {Beyond Token Limits: Assessing Language Model Performance on Long Text Classification},
  author = {Miklós Sebők and Viktor Kovács and Martin Bánóczy and Daniel Møller Eriksen and Nathalie Neptune and Philippe Roussille},
  journal= {arXiv preprint arXiv:2509.10199},
  year   = {2025}
}