中文

委托任务时LLM会损坏您的文档

计算与语言 2026-04-20 v1 人机交互

摘要

大型语言模型(LLM)即将颠覆知识工作,委托工作的出现成为一种新的交互范式(例如,vibe coding)。委托需要信任——即期望LLM将忠实地执行任务而不在文档中引入错误。我们引入了DELEGATE-52以研究AI系统在委托工作流中的准备情况。DELEGATE-52模拟了需要跨52个专业领域(如编程、晶体学和音乐记谱)进行深度文档编辑的长委托工作流。我们对19个LLM进行的大规模实验表明,当前模型在委托过程中会降低文档质量:即使是前沿模型(Gemini 3.1 Pro、Claude 4.6 Opus、GPT 5.4)在长工作流结束时也会平均损坏25%的文档内容,其他模型的失败则更为严重。附加实验表明,智能体工具使用未能改善在DELEGATE-52上的性能,且损坏的严重程度会因文档大小、交互长度或干扰文件的存在而加剧。我们的分析表明,当前的LLM是不可靠的受托者:它们会引入稀疏但严重的错误,这些错误会悄无声息地损坏文档,并在长交互中不断累积。

关键词

引用

@article{arxiv.2604.15597,
  title  = {LLMs Corrupt Your Documents When You Delegate},
  author = {Philippe Laban and Tobias Schnabel and Jennifer Neville},
  journal= {arXiv preprint arXiv:2604.15597},
  year   = {2026}
}