多谓词性越好——微调层空间几何的简要观察
计算与语言
2025-01-13 v1 机器学习
摘要
深度学习模型的解释是一个快速发展的领域,其中语言模型尤其受到关注。实现这一目标有多种方法,包括训练更简单的模型来复制神经网络预测,以及分析模型的潜在空间。后一种方法不仅使我们能够识别模型决策过程中的模式,还能理解其内部结构的特征。在本文中,我们分析了BERT模型在额外语法模块和包含新语法结构(多谓词性)的数据训练下,其内部表示的变化。我们发现,添加单个语法层会导致模型在内部将新旧语法系统分离,从而在困惑度指标上提升整体性能。
引用
@article{arxiv.2501.05503,
title = {The more polypersonal the better -- a short look on space geometry of fine-tuned layers},
author = {Sergei Kudriashov and Veronika Zykova and Angelina Stepanova and Yakov Raskind and Eduard Klyshinsky},
journal= {arXiv preprint arXiv:2501.05503},
year = {2025}
}
备注
Neuroinformatics 2024