中文

奇妙的语义及其所在:探究生成式 LLM 的哪些层反映词汇语义

计算与语言 2024-06-11 v2

摘要

大型语言模型在通用语言理解任务中取得了显著成功。然而,作为以预测下一个 token 为目标的一类生成式方法,与其前身(如类 BERT 架构)不同,这些模型语义随深度演变的规律尚未被充分探索。在本文中,我们通过使用上下文词汇识别任务探测 Llama2(一种流行的 LLM)在每层末尾的隐藏状态,具体研究了其词汇语义的自底向上演变。我们的实验表明,较低层的表示编码了词汇语义,而较高层由于语义归纳能力较弱,主要负责预测。这与具有判别式目标的模型(如掩码语言建模)形成对比,后者在较高层获得更好的词汇语义。通过提示策略中最后一个无意义符号(如标点符号)的隐藏状态所表现出的性能单调递增,进一步支持了这一结论。我们的代码可在 https://github.com/RyanLiut/LLM_LexSem 获取。

关键词

引用

@article{arxiv.2403.01509,
  title  = {Fantastic Semantics and Where to Find Them: Investigating Which Layers of Generative LLMs Reflect Lexical Semantics},
  author = {Zhu Liu and Cunliang Kong and Ying Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2403.01509},
  year   = {2024}
}

备注

Accepted to Findings of ACL 2024