基于矩阵乘积态的可解释自然语言处理
无序系统与神经网络
2022-05-19 v2 统计力学
计算与语言
机器学习
量子物理
摘要
尽管循环神经网络(RNNs)在自然语言处理(NLP)中取得了经验性成功,但由于其内在复杂的非线性计算,对 RNNs 的理论理解仍然有限。我们通过一类称为循环算术电路(RACs)的 RNNs 与矩阵乘积态(MPS)之间的映射,系统分析了 RNNs 在一个普遍存在的 NLP 任务——影评情感分析中的行为。使用冯·诺依曼纠缠熵(EE)作为信息传播的代理指标,我们表明单层 RACs 具有最大信息传播容量,这体现在 EE 的饱和上。将键维数扩大到 EE 饱和阈值以上并不会提高模型预测准确率,因此可以推断出最佳估计数据统计量的最小模型。尽管饱和 EE 小于面积定律所允许的最大 EE,我们的最小模型在现实情感分析数据集中仍达到了约 99% 的训练准确率。因此,低 EE 并不能成为不在 NLP 中采用单层 RACs 的理由。与“长距离信息传播是 RNNs 成功主要来源”的普遍看法相反,我们表明单层 RACs 从信息传播与词向量嵌入之间的微妙相互作用中获得高表达能力。我们的工作利用多体量子物理的工具,阐明了 RACs 中学习的现象学,更广义地阐明了 RNNs 用于 NLP 的可解释性。
引用
@article{arxiv.2112.08628,
title = {Explainable Natural Language Processing with Matrix Product States},
author = {Jirawat Tangpanitanon and Chanatip Mangkang and Pradeep Bhadola and Yuichiro Minato and Dimitris G. Angelakis and Thiparat Chotibut},
journal= {arXiv preprint arXiv:2112.08628},
year = {2022}
}
备注
25 pages, 7 figures. Accepted for publication in New Journal of Physics