中文

从工具到队友:评估多会话编码交互中的 LLM

计算与语言 2025-06-10 v2

摘要

大型语言模型越来越多地用于工作环境中的各种任务,在孤立解决单个问题方面表现出色。然而,它们是否也能在长期交互中进行有效协作?为了研究这一点,我们引入了 MemoryCode,这是一个合成的多会话数据集,旨在测试 LLM 在无关信息干扰下跟踪和执行简单编码指令的能力,从而模拟真实场景。虽然我们测试的所有模型都能很好地处理孤立指令,但即使是 GPT-4o 等最先进的模型,当指令分散在不同会话中时,其性能也会下降。我们的分析表明,这是由于它们无法在长指令链上检索和整合信息。我们的结果突出了当前 LLM 的一个根本局限,限制了它们在长期交互中有效协作的能力。

关键词

引用

@article{arxiv.2502.13791,
  title  = {From Tools to Teammates: Evaluating LLMs in Multi-Session Coding Interactions},
  author = {Nathanaël Carraz Rakotonirina and Mohammed Hamdy and Jon Ander Campos and Lucas Weber and Alberto Testoni and Marzieh Fadaee and Sandro Pezzelle and Marco Del Tredici},
  journal= {arXiv preprint arXiv:2502.13791},
  year   = {2025}
}

备注

Published as conference paper at ACL 2025