中文

PARMESAN:面向密集预测任务的无参数记忆搜索与直推

机器学习 2025-04-25 v3 机器学习

摘要

本工作通过直推推理来解决深度学习中的灵活性问题。为了适应新数据和任务(例如在持续学习中),现有方法通常涉及调整可学习参数或从头开始完全重新训练,使得此类方法在实践中不够灵活。我们认为,通过直推将计算与记忆分离的概念可以作为解决这些问题的垫脚石。因此,我们提出了 PARMESAN(无参数记忆搜索与直推),这是一种可扩展的方法,利用记忆模块来解决密集预测任务。在推理时,搜索记忆中的隐藏表示以找到对应的模式。与依赖持续训练可学习参数的其他方法相比,PARMESAN 仅通过修改存储内容进行记忆巩固来学习。我们的方法与常用架构兼容,并规范地迁移到 1D、2D 和 3D 基于网格的数据。我们在持续学习这一复杂任务中展示了该方法的能力。PARMESAN 的学习速度比既定基线快 3-4 个数量级,同时在预测性能、硬件效率和知识保留方面表现相当。

关键词

引用

@article{arxiv.2403.11743,
  title  = {PARMESAN: Parameter-Free Memory Search and Transduction for Dense Prediction Tasks},
  author = {Philip Matthias Winter and Maria Wimmer and David Major and Dimitrios Lenis and Astrid Berg and Theresa Neubauer and Gaia Romana De Paolis and Johannes Novotny and Sophia Ulonska and Katja Bühler},
  journal= {arXiv preprint arXiv:2403.11743},
  year   = {2025}
}

备注

This is the author's accepted manuscript of a paper published in Lecture Notes in Computer Science (LNCS), volume 15297, Proceedings of DAGM GCPR 2024. 25 pages, 7 figures