空间数据上的因果遮蔽:一种学习空间数据集的信度论证
人工智能
2025-11-03 v1 机器学习
机器学习
摘要
语言模型传统上基于因果遮蔽进行设计。在具有空间或关系结构的领域中,人们常认为因果遮蔽不合适,因而采用顺序化方法。然而,关于在非序列数据上接受因果遮蔽引入的信息损失是否可行的问题,因缺乏同时提供空间与序列表示的数据集而接受较少直接研究。本文在棋局这一天然支持两种表示方式的领域中探讨此问题。我们在空间(棋盘)数据和顺序(棋步)数据上分别训练具有双向和因果自注意力机制的语言模型。结果表明,训练于空间棋盘状态的模型——即便采用因果遮蔽——在棋力上 consistently 优于训练于顺序数据的模型。虽然实验仅限于棋局,但我们的发现具有方法论意义:将因果遮蔽应用于空间数据是一种可行的训练空间数据单模态大语言模型的做法,且在某些领域甚至优于顺序化处理。
引用
@article{arxiv.2510.27009,
title = {Causal Masking on Spatial Data: An Information-Theoretic Case for Learning Spatial Datasets with Unimodal Language Models},
author = {Jared Junkin and Samuel Nathanson},
journal= {arXiv preprint arXiv:2510.27009},
year = {2025}
}
备注
8 pages, NeurIPS 2025