中文

理解大语言模型在多实例处理中的性能下降:实例数量与上下文长度的作用

人工智能 2026-04-22 v2 计算与语言

摘要

用户常依赖大语言模型(LLM)处理多个文档或对大量实例进行分析。例如,分析多部电影评论的整体情感,需要LLM分别处理每条评论的情感,以提供最终的聚合答案。尽管LLM在处理单个任务时性能通常很高,但关于LLM在处理多实例输入时的表现却鲜有研究。本文对LLM在多实例处理(MIP)能力进行全面评估,聚焦于LLM在各类单项任务中表现突出的场景。结果显示,所有LLM都遵循一种模式:在小规模实例数量(约20-100)时轻微性能下降,随后在更大实例数量上出现性能崩溃。关键在于,虽然上下文长度与此性能下降相关,但实例数量对最终结果的影响更为显著。这一发现表明,在为MIP优化LLM性能时,需关注上下文长度以及特别是实例数量。

关键词

引用

@article{arxiv.2603.22608,
  title  = {Understanding LLM Performance Degradation in Multi-Instance Processing: The Roles of Instance Count and Context Length},
  author = {Jingxuan Chen and Mohammad Taher Pilehvar and Jose Camacho-Collados},
  journal= {arXiv preprint arXiv:2603.22608},
  year   = {2026}
}

备注

ACL 2026