中文

CogCanvas:长期大语言模型对话中基于原话内容的制品抽取

人工智能 2026-01-07 v2 计算与语言 信息检索

摘要

对话摘要会丢失细微差别:当被问及40轮后关于编码偏好的讨论时,摘要仅记得“使用类型提示”,却丢弃了关键约束“到处都要”(精确匹配率仅为19.0%,而本方法达到93.0%)。我们提出CogCanvas,一种受团队在白板上存储共享记忆方式启发的无训练框架。不同于压缩对话历史,CogCanvas抽取基于原话内容的制品(决策、事实、提醒),并通过时序感知图进行检索。在LoCoMo基准测试中(包含ACL 2024发布的全部10个对话),CogCanvas在无训练方法中实现最高整体准确率(32.4%),相较于RAG(24.6%)提升7.8个百分点,在复杂推理任务中表现显著:时序推理提升20.6个百分点(32.7% vs 12.1% RAG),多跳问题提升1.1个百分点(41.7% vs 40.6% RAG)。CogCanvas在单跳检索任务中也领先(26.6% vs 24.6% RAG)。消融研究表明,BGE重排序贡献了7.7个百分点的提升,是CogCanvas性能提升的最大贡献者。虽然高度优化的方法通过专门训练(如EverMemOS:~92%)可获得更高的绝对分数,但我们的无训练方法为实践者提供了一个即插即用且显著优于标准基线的替代方案。代码与数据:https://github.com/tao-hpu/cog-canvas

关键词

引用

@article{arxiv.2601.00821,
  title  = {CogCanvas: Verbatim-Grounded Artifact Extraction for Long LLM Conversations},
  author = {Tao An},
  journal= {arXiv preprint arXiv:2601.00821},
  year   = {2026}
}

备注

15 pages, 5 figures. Submitted to ACL Rolling Review January 2026