面向字符的Transformer学习了不规则形态学模式,却没有像人类一样进行泛化
计算与语言
2026-02-17 v1
摘要
神经网络能否作为形态学学习的认知模型仍是一个未解决的问题。最近的研究表明,编码器-解码器模型可以获得不规则模式,但它们是否像人类一样对这些模式进行泛化尚不清楚。我们使用西班牙语L型形态学(Spanish L-shaped morphome),其中只有第一人称单数体现(例如pongo `I put')的词形与所有反问形式(例如ponga, pongas)共享词干,尽管这些形式在显而物学、语义或句法上没有明显的动力学。我们比较了五个编码器-解码器Transformer,这些模型在两个维度上有所不同:顺序编码与位置不变编码,以及原子标签表示与分解标签表示。位置编码起决定性作用:位置不变模型即使在L型动词在训练中稀缺的情况下也能恢复正确的L型范式聚类,而顺序位置编码模型只能部分捕获该模式。然而,所有模型都无法对新形式进行积态泛化。位置不变模型在反问单元中泛化L型词干,但未将其扩展到第一人称单数体现,产生一种基于情态的泛化而非L型形态学模式。人类则恰恰相反,优先于反问形式对第一人称单数体现进行泛化。所有模型都未能复制人类的模式,凸显了统计模式再现与形态学抽象之间的差距。
引用
@article{arxiv.2602.14100,
title = {Character-aware Transformers Learn an Irregular Morphological Pattern Yet None Generalize Like Humans},
author = {Akhilesh Kakolu Ramarao and Kevin Tang and Dinah Baer-Henney},
journal= {arXiv preprint arXiv:2602.14100},
year = {2026}
}