通过神经元元架构获取与适应新任务的先验知识
人工智能
2025-07-16 v2
摘要
将先前经验的知识迁移到新任务的能力是智能体(包括人类和计算模型)的关键能力。这一原则是迁移学习的基础,其中大型预训练神经网络被微调以适应下游任务。迁移学习在任务适应速度和性能方面取得了显著成功。然而,在数据稀缺的领域,构建大型预训练模型或基础模型是不可行的——例如计算化学、计算免疫学和医学影像。为此,我们的工作聚焦于设计架构,在缺乏大量数据的条件下高效获取先验知识。特别是,我们演示了利用神经记忆仅通过少量样本即可实现非平稳分布的适应。随后,我们展示,基于 Model Agnostic Meta-Learning (MAML) 训练的超网络设计能够获取比标准网络更通用的先验知识。随后,我们将超网络应用于 3D 场景生成,表明它们仅需少量训练场景即可高效获取先验知识,从而实现更快的文本到 3D 生成。我们随后将超网络框架扩展到在有限数据下对新场景进行 3D 分段,通过高效迁移先前观察场景的先验知识实现。最后,我们将现有分子生成方法用作预训练框架,以提高分子属性预测性能,解决计算免疫学中的关键挑战。
引用
@article{arxiv.2507.10446,
title = {Acquiring and Adapting Priors for Novel Tasks via Neural Meta-Architectures},
author = {Sudarshan Babu},
journal= {arXiv preprint arXiv:2507.10446},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2310.17075