LSTM中被忽视的关键因素:基于二叉树的数据输入重排序、权重正则化与门控非线性化
机器学习
2025-09-03 v1 人工智能
摘要
当前机器学习文献与应用中的LSTM模型虽利用门控机制实现长期信息存储,却未能最优聚焦于特定旧索引或长期信息。本文阐述了输入重排序以优先处理特定索引的方法。此外,文献中未发现任何LSTM方法探讨权重归一化,亦未通过主监督损失函数选择合适权重与L_p范数。本文指出哪种范数最能捕捉权重间关系,以实现平滑或稀疏化。最后,门控作为输入与状态的加权表征,控制当前输入对历史输入(~状态)的削弱程度,未足够非线性化(通过小型前馈神经网络)。类似注意力机制,经过非线性化的门控可更轻易地筛选信息,强化对历史输入的聚焦。此类非线性化方法至今无人提出。本文在文本分类任务中实现并对比简单LSTM,结果表明显著提升LSTM准确率。
引用
@article{arxiv.2509.00087,
title = {Yet Unnoticed in LSTM: Binary Tree Based Input Reordering, Weight Regularization, and Gate Nonlinearization},
author = {Mojtaba Moattari},
journal= {arXiv preprint arXiv:2509.00087},
year = {2025}
}