优化感觉神经元:用于强化学习中置换不变神经网络加速收敛的非线性注意力机制
机器学习
2025-06-24 v4 人工智能
摘要
训练强化学习 (RL) 智能体通常需要大量的计算资源和漫长的训练时间。为了应对这一挑战,我们基于先前引入的具有置换不变感觉处理的神经架构进行了研究。我们提出了一种改进的注意力机制,该机制对键向量 (K) 应用非线性变换,通过自定义映射函数产生丰富的表示 (K')。这种非线性注意力 (NLA) 机制增强了注意力层的表示能力,使智能体能够学习更具表达力的特征交互。因此,我们的模型实现了显著更快的收敛速度和更高的训练效率,同时保持了与基线相当的性能。这些结果突出了非线性注意力机制在不牺牲有效性的情况下加速强化学习的潜力。
引用
@article{arxiv.2506.00691,
title = {Optimizing Sensory Neurons: Nonlinear Attention Mechanisms for Accelerated Convergence in Permutation-Invariant Neural Networks for Reinforcement Learning},
author = {Junaid Muzaffar and Khubaib Ahmed and Ingo Frommholz and Zeeshan Pervez and Ahsan ul Haq},
journal= {arXiv preprint arXiv:2506.00691},
year = {2025}
}
备注
there was an error with the figures and the algorithm, working on it to correct it, will publish with updated and correct algorithm and results