中文

Gyan:一种可解释的神经符号语言模型

计算与语言 2026-05-14 v2 人工智能 新兴技术 机器学习

摘要

基于 Transformer 的预训练大型语言模型已变得无处不在。越来越多的证据表明,即使进行大规模预训练,这些模型也无法捕获完整的组合上下文,更不用说完全类似于人类的上下文了。此外,由于架构本身的性质,这些模型会产生幻觉,难以维护,不易解释,并且需要庞大的计算资源进行训练和推理。在此,我们描述了 Gyan,一种基于新型非 Transformer 架构的可解释语言模型,它没有上述任何局限性。Gyan 在 3 个被广泛引用的数据集上达到了 SOTA 性能,并在两个专有数据集上表现更优。该新型架构将语言模型与知识获取和表示解耦。该模型借鉴了修辞结构理论、语义角色理论和基于知识的计算语言学。Gyan 的语义表示结构捕获了完整的组合上下文,并试图通过将上下文扩展为“世界模型”来模仿人类。AI 模型的采用关键取决于信任和透明度,尤其是在关键任务用例中。总而言之,我们的结果表明,创建适用于关键任务任务的、值得信赖且可靠的模型是可能的。我们相信我们的工作在指导语言模型透明和可信架构的发展方面具有巨大潜力。

关键词

引用

@article{arxiv.2605.04759,
  title  = {Gyan: An Explainable Neuro-Symbolic Language Model},
  author = {Venkat Srinivasan and Vishaal Jatav and Anushka Chandrababu and Geetika Sharma},
  journal= {arXiv preprint arXiv:2605.04759},
  year   = {2026}
}

备注

also submitted to NeurIPS 2026